Daily Briefing

2026-07-20 AI Daily

模型記憶、推理強度與 KV 快取,都走向更細緻的可調控制 3 則 AI 技術與產品重點:Fractale-350M-base 用 8 個向量槽保存跨區塊狀態、BeeLlama.cpp v0.4.0 讓近期 KV 快取維持高精度、推理強度源自後訓練與 token 預算控制

ThreadsInstagram

01 / 開源模型

Fractale-350M-base 用 8 個向量槽保存跨區塊狀態

Fractale-350M-base 以 MIT 授權公開 386M 參數權重與研究程式碼。模型每讀完一個 512-token 區塊,就把摘要寫進 8 個向量槽,再由 hypernetwork 展開成低秩 MLP fast weights,作為跨區塊唯一的資訊通道。作者測得 carried bank 相較 reset bank,在間隔一段內容後續寫程式碼時,交叉熵改善 9.42 nats,但這是模型自身消融,不是同算力外部 benchmark。它仍是未指令微調、未做安全對齊的研究用基礎模型。

關鍵影響:先驗證記憶消融再談長文本效益

來源:Fractale-350M-base — a 386M LM whose only long-term memory is 8 fast-weight slots

02 / 推論工具

BeeLlama.cpp v0.4.0 讓近期 KV 快取維持高精度

BeeLlama.cpp v0.4.0 以新版 llama.cpp 為基礎,加入 KVarN2 到 KVarN8 的 KV-cache 量化,並用 --kv-tail-tokens 讓近期 token 保持 F16 或 BF16、較舊快取維持量化。專案以 Qwen 3.6 27B、64K context、RTX 3090 測試後,建議先從 1024-token 高精度尾段起步,但也提醒 Gemma 4 的滑動視窗會削弱記憶體優勢。導入前仍需以目標模型與硬體重跑品質、VRAM 與吞吐量。

關鍵影響:用目標模型重測品質與 VRAM

來源:Anbeeld/beellama.cpp v0.4.0

03 / 技術解析

推理強度源自後訓練與 token 預算控制

Sebastian Raschka 拆解多段推理強度(reasoning effort)的常見做法。模型可在 SFT 階段學習強度標籤與不同長度的目標回答,也可在 RLVR 的獎勵中依強度調整每個生成 token 的代價,再於推論時透過 system prompt 或 chat template 選擇模式。這些控制必須在後訓練階段學會,不能只對任意模型加一句提示就得到同等效果。AI agent 開發團隊應按任務一起量測正確率、延遲與 API token 成本。

關鍵影響:按任務量測正確率、延遲與成本

來源:Sebastian Raschka - Controlling Reasoning Effort in LLMs