隨著大型語言模型(LLM)處理的文本越來越長,存放對話特徵的 KV Cache 成為嚴重的效能瓶頸。Google Research 近期發表了全新的壓縮演算法 TurboQuant,透過獨創的數學視角轉換,徹底解決了傳統量化技術中「縮放比例(Scale Factor)」佔用額外記憶體的難題。這項技術在 H100 GPU 上實現了 8 倍的運算加速,同時將記憶體需求降低 6 倍,且達成「零準確度損失」的完美表現。

  1. 傳統量化的痛點:消失的記憶體紅利
    在 AI 生成過程中,系統必須儲存已生成的向量特徵(KV Cache)。為了節省空間,業界常使用「量化」來調低資料精度,但卻面臨以下困境。
    隱藏成本: 壓縮資料時,必須額外記錄「縮放比例小抄」,否則 AI 無法還原原始數值。
    額外開銷(Overhead): 當向量被切成小區塊壓縮時,這些密密麻麻的小抄(每個數字多佔 1-2 位元)抵銷了壓縮帶來的好處,導致效率不彰。

  2. TurboQuant 的核心機制:極致的數學轉換
    TurboQuant 透過兩個關鍵步驟,優雅地繞過了傳統量化的限制。
    第一步:PolarQuant「視角轉換」捨棄傳統的 $x, y, z$ 座標,改用極座標(半徑 $r$ 與角度 $\theta$)來表達。由於角度 $\theta$ 具備天然邊界($0^\circ$ 至 $360^\circ$),不需儲存縮放比例。針對無邊界的半徑 $r$,研發團隊利用維度遞減的數學技巧(將 128 維半徑兩兩轉換,最終收斂至 1 維),極大化地減少了需要儲存的參數。
    第二步:QJL 誤差補償由於電腦在儲存角度時會進行「等份切分」(如 360 度切成 8 份),不可避免會產生捨入誤差。TurboQuant 會計算原始向量與等份向量的差值,利用正負符號進行回正補償,確保還原後的資料與原始特徵高度一致。

  3. 驚人的實測表現與產業影響
    研究團隊在 Gemma 與 Mistral 等模型上進行了「大海撈針(Needle In A Haystack)」長文本測試,數據顯示。
    效能暴增: 在 H100 GPU 上,4 位元的 TurboQuant 計算速度比未量化的 32 位元系統快了 8 倍。

    空間節省: 成功將 KV Cache 的記憶體佔用縮減至少 6 倍。
    應用廣泛: 這項技術不僅能解除 Gemini 等長文本模型的快取瓶頸,未來更能應用於「語意搜尋」資料庫,讓數十億規模的向量查詢變得更輕量、更快速。

stanCode daily AI科技新聞
2026.3.27 | Google 撼動記憶體股票的 TurboQuant、如何優化 App 與網頁 AI、Databricks 的資安產品 Lakewatch

🔗收聽連結🔗
一起來了解更多AI相關新聞吧!

Close Menu