Qwen3.5 模型架構與 GDN 上下文管理技術
.作者:Jollen
.日期:July 27, 2026 at 8:00 AM
近期,開源 LLM 模型受到很大關注;「開放權重」的焦點,一直都在「參數量」,而且「越多越好」成為顯學。
前言
最新實際使用了幾個開放權重模型後,對 Qwen3 特別感到興趣。Qwen3 的 GDN 架構很有趣,更令筆者更意外的是,Qwen3.5 0.8B 模型,在日常對話與寫作能力方面,有不錯的表現。
Qwen3.5 0.8B 模型,對記憶體的需求不高,因此用來打造實驗性質的 Edge AI 應用也很適合。
Qwen3 GDN 架構
Gated DeltaNet 簡稱 GDN,主要負責維護壓縮後的上下文狀態。
Qwen3.5 採用 Gated DeltaNet 與 Gated Attention 組成的混合模型架構。
以 Qwen3.5 0.8B 為例,內部語言模型共有 24 層,其中包含 18 層的 Gated Delta Net 與 6 層 Gated Attention。
([3 層 Gated Delta Net + 1 層 Gated Attention]) x 6(重複 6 次)= 24 層。
從 KV cache 理解上下文成本
上述架構中的 Gated Attention 負責全局注意力機制,它根據目前提示詞內容,查詢歷史 Key 與 Value。
典型的 Transformer 機制,將歷史 token 的 Key 與 Value 保存在 KV cache,並進行查詢(Query);即 QKV 矩陣。隨著長時間對話,KV cache 會變大,因為 KV cache 不是固定大小:
- 長上下文會占用更多記憶體
- 影響行動裝置上的功耗
- 影響推論速度與執行穩定性
簡單說,就是模型「開始變笨」。相較之下,GDN 使用「固定大小」的 recurrent state 來保存上下文;每次進行 token 推論時,LLM 模型會先讀取歷史狀態,再將新的資訊寫回狀態。
Recurrent state 是可持續更新的狀態矩陣;意思是,GDN 不需要保存每個歷史 token 的 Key 與 Value。這種注意力架構,能將不斷成長的歷史資訊,壓縮到固定大小的 recurrent state。
GDN 如何更新記憶
那麼,GDN 倒底要如何更新「記憶」呢?
GDN 的狀態管理包含 Decay Gate 與 Delta Rule:
- Decay Gate 是控制舊狀態衰減程度的門控機制
- Delta Rule 則是修正既有 key-value 關聯的狀態更新規則
Decay Gate 控制舊資訊的保留程度。當 Gate 數值接近 1 時,先前狀態會保留較多內容;當 Gate 數值接近 0 時,舊資訊會較快減弱。
白話解釋:資訊會老化、衰減
Delta Rule 則是負責更新 key-value 關聯。模型會先根據目前的 key,從狀態讀取既有結果;接著再計算既有結果與新 value 之間的差異,最後將差值寫回記憶。
可以這樣想,GDN 會持續執行保留、讀取、修正與寫入。上下文也會逐步形成一組可持續更新的語意狀態。
簡而言之,Gating 能協助模型快速削弱過時資訊,Delta Rule 則能針對特定關聯進行修正。兩種機制共同構成 GDN 的記憶更新方式。
思考不同的上下文管理
GDN 架構讓我們有不同的 Context(上下文管理)思惟;筆者認為,GDN 對日常對話應用,有很大優勢。因為,對話(Chat)上下文不需要「持久保存」,所以對話資訊很適合「壓縮狀態」。
試想:日常對話(閒聊)講完就忘,也很正常。
不過,要特別注意,對話的表現仍會受到模型規模、訓練資料、提示內容與推論框架影響;不能一概而論。
GDN 架構只能解釋部分上下文行為,無法單獨決定模型的任務能力。
前文提到,GDN 架構的固定狀態,能降低長序列下的記憶體成長,這代表:「歷史資訊」需要共享有限的記憶空間;LLM 必須持續判斷哪些資訊需要保留,哪些資訊可以「衰減」。
語意冗餘:在表達意思時,使用了多餘或無意義的字詞。例如:「剛醒來,好像有點餓,早上也沒吃,想要去哪裡吃,吃什麼,還在想,不然去肯得基好了。」
日常對話,通常具有較多的語意冗餘,這些資訊較適合壓縮後再進入保存狀態;「資訊壓縮」能減少提示詞 token 數,這些壓縮資訊,能提供 LLM 精準的「推論方向」,所以有助於維持「語氣與方向」。
因此,理論上也適合「寫作」場景。至於「寫程式」,則是因為函數名稱、型別、檔案路徑與 SDK API 等,都屬於「高度精準」的字詞表達,所以上下文管理技術也不同。
RAG、語意搜尋與 LLM
第 10 篇,共 10 篇 · 連載中