首頁 -> 內地

DeepSeek梁文鋒署名新論文提出“條件記憶”

分享到:
2026-01-13 17:43 | 稿件來源:香港中通社

【字號:

香港中通社1月13日電  12日晚,中國科企深度求索(DeepSeek)發布與北京大學共同完成的新論文《基於可擴展查找的條件記憶:大型語言模型稀疏性的新維度》,合著作者署名中出現DeepSeek創始人梁文鋒。

香港中通社資料圖

論文提出條件記憶(conditional memory),通過引入可擴展的查找記憶結構,在等參數、等算力條件下顯著提升模型在知識調用、推理、代碼、數學等任務上的表現。

為了實現“條件記憶”,DeepSeek提出的解決方案是一個名為Engram(直譯為:記憶痕跡)的模塊,它將語言建模任務拆解為“靜態模式檢索”與“動態組合推理”兩大分支:前者負責實體、固定短語等確定性知識的快速調取,後者則交由Transformer架構專注完成複雜邏輯運算。

論文最後表示,“我們將條件記憶視為下一代稀疏模型不可或缺的建模原語。”

同時,DeepSeek開源相關記憶模塊Engram。

中國民間科企DeepSeek於2023年7月創立,總部位於杭州,已發布多款具有廣泛影響力的大語言模型。(完)

【編輯:彭玉婷】

視頻

更 多
平均月租1300!啟德最大簡約公屋二期開始入伙
手術輪候有望縮短!港大醫學院引機械臂輔助活體肝臟移植
從害怕到享受 中醫藥的“魔力”正席捲全球
35歲以下年輕人為何會成為購金主力?
【你不知道的香港】在香港,一個車牌可能價值一套房?一起走進車牌拍賣現場!
【通講壇】東風-17發射畫面首公開,釋放何種戰略信號?
用20年“沖上雲霄” 香港首位女總機師的故事