@morphicode_jp

🇯🇵 個人で LLM の量子化リカバリを研究してます お仕事・共同研究・DM お気軽にどうぞ Independent AI researcher · DM open

Joined May 2026
🚨2-bit Gemma 4 31B recovered to near 4-bit baseline performance by changing only 8 bytes. Q2_K patched (~12.6GB) vs unpatched Q4_K_M baseline (~19GB): HellaSwag 70.36% > 63.70% (+6.66pt) Winogrande 66.69% > 65.04% (+1.65pt) ARC-Challenge 46.44% > 44.89% (+1.55pt) GSM8k 93.20% < 95.80% (-2.60pt) So the honest result: Q2_K patched beats Q4_K_M baseline on 3/4 benchmarks. GSM8k remains Q4-favored. Across all four, Q2_K patched is within 0.69pt of unpatched Q4_K_M baseline. Patch: layer_output_scale[25] *= 1.5 layer_output_scale[26] *= 1.5 Two float32 values. 8 bytes total. No training. No calibration. No inference overhead. Paper: doi.org/10.5281/zenodo.20362… Code: github.com/morphicode-jp/f32… HF Q2_K: huggingface.co/morphicode-jp… HF Q4_K_M: huggingface.co/morphicode-jp…
16
16
2
199
1,127,191
期待大だけど、ローカルLLMの無検閲モデルの価値が落ちるような気がする
92
「お前何ができんねん。Fable 5より性能ええんか?」と聞いた結果 ⬇ 「は? 急に本気で聞いてきやがったなクソガキ」
1
65
5/6 名前の話。 探索は、全層をしらみつぶしに調べる screening と 0.05 刻みの細かい倍率探索。針を少しずつずらして効く一点を探し当てる——文字どおり「ツボ」を突く作業でした。だから TSUBO。日本語がそのまま手法名になりました。正式名は needle-point gate patching。 家族: TSUBO-8 (31B, 6/7 公開)、TSUBO-44 (31B, 11 層)、今回の TSUBO-4。数字は書き換え byte 数です。
1
1
100
Local LLMs are entering a new era. nitter.cf/i/status/2063941078739…
🚨2-bit Gemma 4 31B recovered to near 4-bit baseline performance by changing only 8 bytes. Q2_K patched (~12.6GB) vs unpatched Q4_K_M baseline (~19GB): HellaSwag 70.36% > 63.70% (+6.66pt) Winogrande 66.69% > 65.04% (+1.65pt) ARC-Challenge 46.44% > 44.89% (+1.55pt) GSM8k 93.20% < 95.80% (-2.60pt) So the honest result: Q2_K patched beats Q4_K_M baseline on 3/4 benchmarks. GSM8k remains Q4-favored. Across all four, Q2_K patched is within 0.69pt of unpatched Q4_K_M baseline. Patch: layer_output_scale[25] *= 1.5 layer_output_scale[26] *= 1.5 Two float32 values. 8 bytes total. No training. No calibration. No inference overhead. Paper: doi.org/10.5281/zenodo.20362… Code: github.com/morphicode-jp/f32… HF Q2_K: huggingface.co/morphicode-jp… HF Q4_K_M: huggingface.co/morphicode-jp…
4
572
1/5 1-bit jumps to 60%. 4-bit just beat Q8. Gemma 4 31B-it just proved low-bit LLMs are back — and stronger than ever. Remarkably: 1-bit (IQ1_M, 9.5 GB) on GSM8k → 24% → 60% (+36.0pt) The largest improvement across all 12 cells. And 4-bit patched beats Q8 BF16 baseline on every single benchmark. No training. No calibration. No inference overhead. The conventional wisdom on low-bit LLMs has been completely overturned.
🤖 Made with AI
1
1
1
7
292
4/5  The patch works at every bit-level. Across the board. 1-bit  GSM8k +36.0pt 2-bit  HellaSwag +11.21pt 4-bit  GSM8k +15.0pt  (87% — beats Q8 baseline by +17pt) 4-bit  HellaSwag +9.80pt  (73.50% — beats Q8 baseline by +10.17pt) 12 cells, all positive. (See image for the full matrix.) No training. No calibration. No inference overhead.
🤖 Made with AI
1
4
84
5/5 Full reveal tomorrow (Mon May 25) · 22:00 JST. • Paper (arXiv preprint) • 3 GGUFs (1-bit / 2-bit / 4-bit) on HuggingFace • Patch application script on GitHub All free, all open source. CC-BY 4.0. Solo work. The new era of low-bit LLMs begins. Follow @morphicode_jp 🔔 to catch the drop live. Or bookmark this thread. Ready?
4
65