×
In

一句話總結:DeepSeek 低調推出視覺理解實驗模型 V4-Flash-Vision-Exp,純文本能力不減,多模態 Agent 表現大幅躍升,官方宣稱已逼近 Anthropic Claude Opus 4.8 水準,而且 API 現在就能用。

核心要點

  1. 新增多模態能力:DeepSeek-V4-Flash-Vision-Exp 是旗艦純文本模型 V4-Flash 的實驗性延伸版本,正式加入圖像、螢幕截圖等視覺訊息的辨識與行動能力,不再只是「會看字」而已。
  2. 純文本戰力完全保留:官方強調,這款視覺版本的 Agent、推理、世界知識等純文本表現,與 V4-Flash 正式版完全持平,沒有因為多了視覺功能就妥協。
  3. 視覺 Agent 基準測試大躍進:在需要視覺理解的 Agent Benchmark 上,V4-Flash-Vision-Exp 比 V4-Flash 實現「大幅躍升」,多模態 Agent 能力已接近 Anthropic 的 Claude Opus 4.8——這不是追上一般模型,是直接挑戰高階款。
  4. API 即刻啟用:用戶現在就能透過 DeepSeek API 使用這款模型,支援 Chat Completions、Messages、Responses 三種調用格式,方便直接接入各類 Agent 工具,不用等候補名單。
  5. 三種圖片傳入方式:支援圖文混合輸入,可透過 base64 內聯、外部 URL、Files API 三種方式上傳圖片,開發者整合門檻大幅降低
  6. DeepSeek 的視覺老本行再進化:這次不是 DeepSeek 第一次做視覺模型,過去已有 DeepSeek-VL 系列,但這次是將視覺能力直接整合進最先進的旗艦模型系列,戰略意義完全不同。

這款模型來得有點突然,但脈絡並不難懂。DeepSeek 在純文本模型 V4-Flash 上已經站穩腳跟,現在補上視覺這塊拼圖,直接對標的就是 Anthropic 的強項——多模態 Agent 應用。說真的,「接近」Claude Opus 4.8 這個說法很精準,因為它不是全面超車,而是在特定視覺理解任務上拉近距離,但光是「拉近」這件事,就已經夠多開發者願意掏 API 錢來試了。

從實際應用場景來看,這個模型能做的事比想像中多。螢幕截圖分析、圖文混合的客服 Agent、需要看圖判斷的供應鏈管理——這些過去得串接不同模型的流程,現在可以用單一 API 搞定。而且三種圖片傳入方式幾乎涵蓋了所有開發情境,從簡單的內嵌測試到大型系統的檔案串接,都沒有被卡住的理由。

不過有個細節值得注意:目前它還是「實驗性」版本。DeepSeek 官方在推文中也特別標註了 Experimental,這意味著效能可能還有波動,穩定度需要時間驗證。對於追求穩定的企業級應用來說,現階段可能還不是直接上線的時機,但對於想要搶先測試、或是開發實驗性產品的團隊來說,現在就是進場點。

編輯觀點:
從產業面來看,DeepSeek 這一手真正的意義不在於「追上 Anthropic」這個口號,而是在於它證明了視覺理解能力可以無痛附加在既有旗艦模型上,而不犧牲文本表現。這對中小型團隊來說是好事——因為你不用為了視覺功能而降級使用次級模型,也不用為了純文本效能而放棄多模態應用。如果這條技術路徑走得通,2026 下半年到 2027 年,我們會看到更多「純文本模型 + 視覺外掛」的組合出現,而不是非得等下一代原生多模態旗艦。對開發者來說,現在最務實的做法就是先試 API,把圖片輸入的穩定度和延遲摸清楚,再決定要不要搬進正式產品線。

最後還是要回到一個實際問題:你現在手上的產品或專案,真的需要視覺理解能力嗎?如果答案是「有也不錯」,那你大可以再等三個月,看這款實驗模型轉正之後的表現;但如果答案是「沒有視覺功能就卡住了」,那現在就是進場測試的最好時機——畢竟 API 已經開了,門檻也夠低,跑一次測試花不了多少時間,卻能讓你搶先別人好幾步。

一句話結論

DeepSeek 用一款實驗性視覺模型證明了自己的多模態野心,API 已開、測試可跑,但「接近」不等於「超越」,實際落地的穩定度才是接下來的觀察重點。

本文改寫整理自公開新聞來源,原始報導由科技新報發布。

常見問題 FAQ

DeepSeek V4-Flash-Vision-Exp 跟 V4-Flash 有什麼不同?

V4-Flash-Vision-Exp 是 V4-Flash 的實驗性多模態版本,新增了圖像和螢幕截圖的理解能力,但純文本表現(Agent、推理、世界知識)與 V4-Flash 正式版完全一致。

這款模型現在能用嗎?

可以,目前已經在 DeepSeek API 平台上線,支援 Chat Completions、Messages、Responses 三種調用格式,並提供 base64、外部 URL、Files API 三種圖片傳入方式。

它真的比得上 Anthropic Claude Opus 4.8 嗎?

官方說法是「接近」而非「超越」,具體是在多模態 Agent 能力的基準測試上大幅躍升,已逼近 Opus 4.8 的水準,但實際表現仍需更多公開測試驗證。

這款模型適合用來做什麼?

適合需要同時處理文本和視覺訊息的 Agent 應用,例如螢幕截圖分析、圖文混合客服、視覺輔助的供應鏈管理、以及需要看圖判斷的自動化流程。

實驗性版本會有什麼風險?

實驗性版本代表效能可能仍有波動,穩定度、延遲和輸出品質可能不如正式版穩定,建議先進行內部測試,確認符合需求後再考慮導入正式產品線。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

Related Posts

In

三星、SK海力士在中國押注數百億:2027年NAND產能大戰背後的AI算力焦慮

一個數字震驚了半導體業界:三星電子正在西安廠...

Read out all