首頁 -> 內地

DeepSeek V4 Pro深夜低調登場 實力評測直逼頂級AI旗艦Claude Fable 5

分享到:
2026-08-13 11:44 | 稿件來源:香港新聞網

【字號:

香港新聞網8月13日電  北京時間8月12日週三深夜,當大多數科技愛好者還沉浸在Grok 4.6發佈的熱鬧之中時,deepseek-v4-pro對應的模型版本低調登場。真正讓開發者圈子沸騰的,是已經在社區中廣泛流傳的一份評測對比表,整體能力出現了大幅提升, 實力直逼頂級AI旗艦Claude Fable 5。

然而,與這份低調形成鮮明反差的,是市場迅速湧現的高度關注。因為幾乎就在同一個夜晚,馬斯克旗下SpaceXAI剛剛放出了Grok 4.6。兩款主打高性價比的前沿模型在同一天“撞車”,AI大模型領域的競爭格局再度被攪動。

API悄悄換版,官方更新日誌卻一片空白

週三(12日)深夜,DeepSeek API官方文檔的“模型 & 價格”頁面已悄悄更新,deepseek-v4-pro對應的模型版本從此前的預覽版正式切換為DeepSeek-V4-Pro-0813。沒有盛大的發佈會,沒有社交媒體的官宣海報,甚至連更新日誌頁面都還停留在7月31日V4-Flash的公告上——DeepSeek V4 Pro正式版,就這樣在午夜時分以一種極其低調的方式登場了。

這次V4 Pro正式版的上線方式,與其說是“發佈”,不如說是“默默就位”。


12日深夜,DeepSeek 官網頁面已悄悄更新DeepSeek V4 Pro版。


從DeepSeek官網的細節來看,變化發生在幾個關鍵頁面。API文檔的模型列表中,deepseek-v4-pro的版本號已經更新為DeepSeek-V4-Pro-0813;該模型支持1M上下文、最高384K輸出,並完整支持JSON Output、Tool Calls、Responses API、Anthropic API以及FIM等功能。“首次調用API”頁面也同步更新,將deepseek-v4-pro列為可調用模型,並提供了思考模式調用的示例代碼。

但與之形成對比的是,DeepSeek官方的更新日誌頁面最後一條記錄仍然是7月31日的V4-Flash正式版更新。那條公告當時明確寫道:“7月31日僅升級V4-Flash API,V4-Pro API及App/Web端模型並未改變”,並表示“DeepSeek-V4-Pro正式版將會盡快發佈”。如今“盡快”已經到來,但正式的產品公告卻遲遲未見。

最先嗅到變化的不是新聞記者,而是夜間調用API的開發者。他們發現返回的模型標識已經變了。也正因如此,嚴格來說,目前更準確的描述是:DeepSeek V4 Pro正式版已通過API渠道上線,而非DeepSeek完成了一次完整的、面向公眾的產品發佈。

這種“先上架、後官宣”的做法,在AI行業並不罕見,但放在一個正在衝擊前沿第一梯隊的模型身上,仍然讓人感受到DeepSeek一貫的務實與急迫。

智能體測試逼近Claude Fable 5,從預覽版到正式版躍昇明顯

真正讓開發者圈子沸騰的,是已經在社區中廣泛流傳的一份評測對比表。

多家科技媒體援引DeepSeek官方群流出的評測數據稱,DeepSeek-V4-Pro-0813在多項智能體(Agent)測試中的表現已經逼近Anthropic的前沿模型Claude Fable 5,部分項目甚至實現了反超。相比此前的V4 Pro預覽版,整體能力出現了大幅提升。


DeepSeek-V4-Pro-0813在多項智能體(Agent)測試中的表現。


值得注意的是,這次測試的重點並非傳統的知識問答或數學推理,而是智能體能力——也就是AI“真正幹活”的本事:能否調用工具、執行多步驟任務、編寫和修改代碼、持續推進複雜工作流程。這恰恰是DeepSeek V4系列從一開始就押注的方向。

早在今年4月V4預覽版發佈時,DeepSeek就強調V4 Pro在Agentic Coding評測中達到開源模型領先水平,並針對Claude Code、OpenClaw、OpenCode、CodeBuddy等主流Agent產品進行了適配。7月31日V4 Flash正式版上線時,DeepSeek又披露了一組亮眼的智能體基準分數:Terminal Bench 2.1達到82.7、NL2Repo達到54.2、DeepSWE達到54.4、Toolathlon verified達到70.3,並明確表示這些成績遠超V4-Pro-Preview。

如今V4 Pro正式版進一步向Fable 5靠攏,意味著DeepSeek在Agent方向的後訓練和工程優化正在持續兌現為實際任務執行能力。

不過也需要指出,目前流傳的評測數據主要來自官方群和社區渠道,DeepSeek尚未在正式更新日誌中公佈完整的V4-Pro-0813基準成績。這些具體分數仍屬於非官方披露,與DeepSeek正式發布的基準測試不能完全等同看待。

SpaceXAI同日發佈Grok 4.6 競爭剛剛拉開序幕

在能力大幅提升的同時,DeepSeek V4 Pro目前的API定價卻沒有同步上調。

根據官方價格頁面,V4 Pro每百萬Token的緩存命中輸入價格為0.003625美元,緩存未命中輸入為0.435美元,輸出為0.87美元;按人民幣計價口徑,大約對應3元/百萬Token輸入、6元/百萬Token輸出。此前DeepSeek已將V4 Pro價格從首發價永久下調至原價的四分之一,目前仍然維持在這一低位。

但官網的價格頁面上,有一句話格外醒目:“我們計劃在不久的將來上調DeepSeek API服務的整體價格”,並且“預計漲幅較大”。

這讓此次更新多了一層耐人尋味的意味:DeepSeek似乎在漲價之前,先把升級後的模型推向了市場。能力先到位,價格後調整——這更像是一場精心安排的產品切換。

而就在DeepSeek悄然上線的幾個小時前,SpaceXAI剛剛發佈了Grok 4.6。Grok 4.6在Artificial Analysis的GDPVal-AA v2評估中取得1753 Elo,排名第一,超過OpenAI的GPT-5.6 Sol Max和Anthropic的Claude Fable 5,API定價為每百萬輸入Token 2美元、輸出6美元,號稱只有其他前沿模型的一半。

兩款模型幾乎在同一天向市場傳遞了同一個信號:前沿模型的能力差距正在快速縮小,而價格優勢正在成為新的殺手鐧。對於OpenAI、Anthropic等傳統前沿模型廠商而言,壓力已經不僅僅來自“誰的跑分更高”,而是來自一個更根本的問題——當性能足夠接近時,開發者憑什麼為更貴的模型支付數倍成本?

從“便宜”到“能幹活”,DeepSeek V4 Pro-0813與Grok 4.6的同日亮相,某種程度上標誌著AI競爭正在進入一個新階段:比拼的不再只是參數和聊天能力,而是智能體執行效率、Token成本與開發者生態的綜合較量。

這場競爭,或許才剛剛拉開序幕。(完)


【編輯:錢林霞】

視頻

更 多
【通說環球】從復古糖紙到千年瓷都 世界終於讀懂中式審美?
香港米其林推薦餐廳的炒菜機器人 如何征服全球廚房?
【LIVING IN HONG KONG】英國文學碩士立志為港男們“找自我”
【通講壇】20天抵達英國、省40%成本 中國開通穿越北極的新路
【通視街採】一個叉燒包吃足50年?哪些美食是港人最愛?
張雪機車陸續到港 香港機車收藏家興奮開箱
從中亞商場到歐洲空調 中國品牌“圈粉”全球