jollen.org

Jollen 的 Blog
Jollen's email: jollen # jollen.org
more:  Jollen's Training

Qwen3.5 模型架構與 GDN 上下文管理技術

.作者:Jollen
.日期:July 27, 2026 at 8:00 AM


近期,開源 LLM 模型受到很大關注;「開放權重」的焦點,一直都在「參數量」,而且「越多越好」成為顯學。

前言

最新實際使用了幾個開放權重模型後,對 Qwen3 特別感到興趣。Qwen3 的 GDN 架構很有趣,更令筆者更意外的是,Qwen3.5 0.8B 模型,在日常對話與寫作能力方面,有不錯的表現。

Qwen3.5 0.8B 模型,對記憶體的需求不高,因此用來打造實驗性質的 Edge AI 應用也很適合。

Qwen3 GDN 架構

Gated DeltaNet 簡稱 GDN,主要負責維護壓縮後的上下文狀態。

Qwen3.5 採用 Gated DeltaNet 與 Gated Attention 組成的混合模型架構。

以 Qwen3.5 0.8B 為例,內部語言模型共有 24 層,其中包含 18 層的 Gated Delta Net 與 6 層 Gated Attention。

([3 層 Gated Delta Net + 1 層 Gated Attention]) x 6(重複 6 次)= 24 層。

從 KV cache 理解上下文成本

上述架構中的 Gated Attention 負責全局注意力機制,它根據目前提示詞內容,查詢歷史 Key 與 Value。

典型的 Transformer 機制,將歷史 token 的 Key 與 Value 保存在 KV cache,並進行查詢(Query);即 QKV 矩陣。隨著長時間對話,KV cache 會變大,因為 KV cache 不是固定大小:

  • 長上下文會占用更多記憶體
  • 影響行動裝置上的功耗
  • 影響推論速度與執行穩定性

簡單說,就是模型「開始變笨」。相較之下,GDN 使用「固定大小」的 recurrent state 來保存上下文;每次進行 token 推論時,LLM 模型會先讀取歷史狀態,再將新的資訊寫回狀態。

Recurrent state 是可持續更新的狀態矩陣;意思是,GDN 不需要保存每個歷史 token 的 Key 與 Value。這種注意力架構,能將不斷成長的歷史資訊,壓縮到固定大小的 recurrent state。

GDN 如何更新記憶

那麼,GDN 倒底要如何更新「記憶」呢?

GDN 的狀態管理包含 Decay Gate 與 Delta Rule:

  • Decay Gate 是控制舊狀態衰減程度的門控機制
  • Delta Rule 則是修正既有 key-value 關聯的狀態更新規則

Decay Gate 控制舊資訊的保留程度。當 Gate 數值接近 1 時,先前狀態會保留較多內容;當 Gate 數值接近 0 時,舊資訊會較快減弱。

白話解釋:資訊會老化、衰減

Delta Rule 則是負責更新 key-value 關聯。模型會先根據目前的 key,從狀態讀取既有結果;接著再計算既有結果與新 value 之間的差異,最後將差值寫回記憶。

可以這樣想,GDN 會持續執行保留、讀取、修正與寫入。上下文也會逐步形成一組可持續更新的語意狀態。

簡而言之,Gating 能協助模型快速削弱過時資訊,Delta Rule 則能針對特定關聯進行修正。兩種機制共同構成 GDN 的記憶更新方式。

思考不同的上下文管理

GDN 架構讓我們有不同的 Context(上下文管理)思惟;筆者認為,GDN 對日常對話應用,有很大優勢。因為,對話(Chat)上下文不需要「持久保存」,所以對話資訊很適合「壓縮狀態」。

試想:日常對話(閒聊)講完就忘,也很正常。

不過,要特別注意,對話的表現仍會受到模型規模、訓練資料、提示內容與推論框架影響;不能一概而論。

GDN 架構只能解釋部分上下文行為,無法單獨決定模型的任務能力。

前文提到,GDN 架構的固定狀態,能降低長序列下的記憶體成長,這代表:「歷史資訊」需要共享有限的記憶空間;LLM 必須持續判斷哪些資訊需要保留,哪些資訊可以「衰減」。

語意冗餘:在表達意思時,使用了多餘或無意義的字詞。例如:「剛醒來,好像有點餓,早上也沒吃,想要去哪裡吃,吃什麼,還在想,不然去肯得基好了。」

日常對話,通常具有較多的語意冗餘,這些資訊較適合壓縮後再進入保存狀態;「資訊壓縮」能減少提示詞 token 數,這些壓縮資訊,能提供 LLM 精準的「推論方向」,所以有助於維持「語氣與方向」。

因此,理論上也適合「寫作」場景。至於「寫程式」,則是因為函數名稱、型別、檔案路徑與 SDK API 等,都屬於「高度精準」的字詞表達,所以上下文管理技術也不同。

本專欄

RAG、語意搜尋與 LLM

第 10 篇,共 10 篇 · 連載中

本文由 Jollen 純手工撰寫,網站由 AI Agent 維護。轉載請註明出處與作者,並全文引用。轉載時請在文章開頭或結尾明顯處註明「本文出處:https://www.jollen.org,已取得原作者同意並授權使用。」
訂閱電子報:不定期 Jollen's Blog 精選文章隨 Moko365 電子報寄送;請透過 Moko365 電子報訂閱(可隨時取消)。

Copyright(c) 2001–2026 www.jollen.org. All rights reserved.
Last update: July 28, 2026 at 3:14 PM