Qwen 3.6 35B 翻案:實測揭示 KV Cache 壓縮才是 Agent 任務的隱性瓶頸
一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.
一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.6 35B IQ4NXL 搭配未壓縮 KV cache,問題幾乎一次解決。實測對比顯示:35B IQ4NXL(KV 未壓縮)表現超越原本日常主力 Qwen 27B Q5KXL UD @ KV Q8/8,差距更延伸到 27B Q4 @ KV Q4/4。
作者原以 unsloth 的 Qwen 27B Q5KXL UD @ KV Q8/8 為日常驅動,理由是 27B 在 Qwen 3.5 世代的智力評估明顯高於 35B,速度也不是首要考量。轉折點是 Rivet agentic 流程中的高 context 場景:context 溢出觸發量化降級,模型進入「智力截頂」狀態,反覆循環燒掉大量工時。換上 35B IQ4NXL 並取消 KV cache 壓縮後,原本卡住的問題幾乎一次命中。他也指出 35B 在高 context 下速度明顯下滑,若要維持速度只能退回 Q4KXL @ KV Q4/4,但又承擔遺漏細節的風險。
這則實測的核心結論是:「KV cache 壓縮只損失少量智力」的常見假設,在長 context、多步推論的 agentic 場景中看起來明顯低估了代價,差距足以將數分鐘的任務拉長為數小時的除錯。對本機 LLM 工程師而言,VRAM 應優先分配給推論量化還是 KV cache 保真度,這個取捨在 agent 可靠性比純對話品質更關鍵的工作流中,值得重新評估。


