@morphicode_jpi
iAccount based inJapan
About this account
- Account based in
- Japan
- Connected via
- Japan Android App
Account-level information from X, not a live location or the device used for a specific post.
🇯🇵 個人で LLM の量子化リカバリを研究してます お仕事・共同研究・DM お気軽にどうぞ Independent AI researcher · DM open
Joined May 2026
- Tweets43
- Following118
- Followers38
- Likes325
Pinned Tweet
🚨2-bit Gemma 4 31B recovered to near 4-bit baseline performance by changing only 8 bytes.
Q2_K patched (~12.6GB) vs unpatched Q4_K_M baseline (~19GB):
HellaSwag
70.36% > 63.70% (+6.66pt)
Winogrande
66.69% > 65.04% (+1.65pt)
ARC-Challenge
46.44% > 44.89% (+1.55pt)
GSM8k
93.20% < 95.80% (-2.60pt)
So the honest result:
Q2_K patched beats Q4_K_M baseline on 3/4 benchmarks.
GSM8k remains Q4-favored.
Across all four, Q2_K patched is within 0.69pt of unpatched Q4_K_M baseline.
Patch:
layer_output_scale[25] *= 1.5
layer_output_scale[26] *= 1.5
Two float32 values.
8 bytes total.
No training.
No calibration.
No inference overhead.
Paper:
doi.org/10.5281/zenodo.20362…
Code:
github.com/morphicode-jp/f32…
HF Q2_K:
huggingface.co/morphicode-jp…
HF Q4_K_M:
huggingface.co/morphicode-jp…
日本人として応援してるよ。
llm-jp-4 の 33b dense モデルを公開しました!
計算資源の不足もあって去年の秋から訓練し始めてようやく公開です…
順当に 8b や 32b-a3b よりは賢いです
llm-jp.nii.ac.jp/news/202608…
5/6 名前の話。
探索は、全層をしらみつぶしに調べる screening と 0.05 刻みの細かい倍率探索。針を少しずつずらして効く一点を探し当てる——文字どおり「ツボ」を突く作業でした。だから TSUBO。日本語がそのまま手法名になりました。正式名は needle-point gate patching。
家族: TSUBO-8 (31B, 6/7 公開)、TSUBO-44 (31B, 11 層)、今回の TSUBO-4。数字は書き換え byte 数です。
6/6 仕組みの仮説: パッチは層ごとの F32 出力ゲートを増幅し、量子化で弱まった信号を補っている可能性。機構は未確定です。
GGUF + パッチ script + 論文:
📄 doi.org/10.5281/zenodo.20362…
🛠 github.com/morphicode-jp/f32…
🤗 hf.co/morphicode-jp/gemma-4-…
RT / star / 🤗 like 歓迎です。
Local LLMs are entering a new era.
nitter.cf/i/status/2063941078739…
🚨2-bit Gemma 4 31B recovered to near 4-bit baseline performance by changing only 8 bytes.
Q2_K patched (~12.6GB) vs unpatched Q4_K_M baseline (~19GB):
HellaSwag
70.36% > 63.70% (+6.66pt)
Winogrande
66.69% > 65.04% (+1.65pt)
ARC-Challenge
46.44% > 44.89% (+1.55pt)
GSM8k
93.20% < 95.80% (-2.60pt)
So the honest result:
Q2_K patched beats Q4_K_M baseline on 3/4 benchmarks.
GSM8k remains Q4-favored.
Across all four, Q2_K patched is within 0.69pt of unpatched Q4_K_M baseline.
Patch:
layer_output_scale[25] *= 1.5
layer_output_scale[26] *= 1.5
Two float32 values.
8 bytes total.
No training.
No calibration.
No inference overhead.
Paper:
doi.org/10.5281/zenodo.20362…
Code:
github.com/morphicode-jp/f32…
HF Q2_K:
huggingface.co/morphicode-jp…
HF Q4_K_M:
huggingface.co/morphicode-jp…
1/5 1-bit jumps to 60%. 4-bit just beat Q8.
Gemma 4 31B-it just proved low-bit LLMs are back — and stronger than ever.
Remarkably:
1-bit (IQ1_M, 9.5 GB) on GSM8k → 24% → 60% (+36.0pt)
The largest improvement across all 12 cells.
And 4-bit patched beats Q8 BF16 baseline on every single benchmark.
No training. No calibration. No inference overhead.
The conventional wisdom on low-bit LLMs has been completely overturned.
🤖 Made with AI
4/5 The patch works at every bit-level. Across the board.
1-bit GSM8k +36.0pt
2-bit HellaSwag +11.21pt
4-bit GSM8k +15.0pt (87% — beats Q8 baseline by +17pt)
4-bit HellaSwag +9.80pt (73.50% — beats Q8 baseline by +10.17pt)
12 cells, all positive. (See image for the full matrix.)
No training. No calibration. No inference overhead.
🤖 Made with AI
5/5 Full reveal tomorrow (Mon May 25) · 22:00 JST.
• Paper (arXiv preprint)
• 3 GGUFs (1-bit / 2-bit / 4-bit) on HuggingFace
• Patch application script on GitHub
All free, all open source. CC-BY 4.0. Solo work.
The new era of low-bit LLMs begins.
Follow @morphicode_jp 🔔 to catch the drop live.
Or bookmark this thread.
Ready?