×
In

當你拿一張貓咪照片給 ChatGPT 看,它不僅能告訴你「這是一隻橘貓」,還能描述背景的沙發和窗外的光線——聽起來很神,對吧?但假如那張照片裡其實根本沒有貓,AI 卻依然講得口沫橫飛呢?這不是假設,而是當前大型語言模型(LLMs)進化到多模態階段後,浮現的真實困境。

所謂「視覺幻覺」(Visual Hallucinations),指的正是這種情況:AI 在分析圖像時,會生成聽起來頭頭是道、但實際上完全錯誤甚至荒謬的輸出。這不是單一模型的偶發失誤,而是整個生成式 AI 架構的結構性問題。

當統計合理性凌駕於真實:視覺幻覺從何而來?

根據知名學術期刊《Communications of the ACM》的報導,諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 點出核心癥結:LLMs 經過大量文本與影像資料訓練,其輸出本質上只具備「統計學上的合理性」,而非對「真理」的理解。換句話說,AI 不是在「看」圖,而是在「猜」圖——它依據過往學習過的龐大資料分布,推測出最有可能出現的答案。

問題來了。當背景資訊與圖像內容相互矛盾時,幻覺現象會更加頻繁。Michael Pound 舉了一個非常實際的警訊:在醫學影像分析場景中,若 AI 受到其他病患資料的干擾,它可能直接忽略圖像中實際存在的疾病跡象。這不只是「答錯」而已,在真實醫療場域裡,這是可能影響人命的天大漏洞。

加州柏克萊人工智慧研究實驗室(BAIR)的博士後研究員 David Chan 則點出另一個微妙的人性盲點:儘管人類本身也會產生類似的認知錯誤,但大眾對 AI 模型的期望值,遠高於對人類的標準。我們可以原諒實習醫生看錯片子,卻無法容忍 AI 出錯——這不是雙重標準,而是現實。因為我們把 AI 當成「工具」,而工具不該有「幻覺」。

自動駕駛與盲人輔助:當錯誤的代價無法承受

視覺幻覺對兩類應用場景的殺傷力最大:一是安全監控與自動駕駛,二是盲人輔助科技。

在自動駕駛系統中,車輛仰賴視覺模型辨識行人、號誌與障礙物。一旦模型產生幻覺——比方說把陰影誤認為行人而急煞,或更糟,把真正的行人忽略掉——後果不是車輛損壞,而是真實生命的傷亡。目前業界雖已導入光達(LiDAR)等多餘感測器來彌補視覺模型的錯誤,但這只是「貼 OK 繃」,不是根治。

至於盲人輔助科技,Michael Pound 特別強調其危險性:當使用者無法自行驗證 AI 的輸出時,任何錯誤都可能帶來無法挽回的風險。明眼人看到 AI 描述錯誤可以「秒糾正」,但視障者只能選擇信任——而這份信任,目前為止,並不完全可靠。

後驗證太慢、微調不夠:科學界怎麼補這顆洞?

學界與業界目前嘗試的解法主要有兩條路線。第一條是「事後補救」:針對特定任務的影像資料進行模型微調(fine-tuning),並透過額外的 AI 模型來檢查原先模型的輸出。問題是,這種後驗證(post-hoc verification)方法效率低落——它不僅跑得慢,而且只能「拒絕」錯誤回應,無法直接「修正」錯誤。簡單說,它會告訴你「這題不對」,卻不會告訴你「正解是什麼」。

第二條是「同步攔截」。新提出的 REVERSE 框架嘗試在 AI 生成回應的過程「當下」就檢查幻覺。其運作方式是:訓練模型將詞語分類為「自信」或「不自信」,並在生成影像描述時給予每個詞彙信心評分,從而實現即時修正。David Chan 將此形容為一種「推論技巧」,能讓部署中的系統根據預期的錯誤率來調整應對策略。

不過,這兩條路線都沒有真正解決根本問題。REVERSE 只是「抓漏」,微調只是「限縮場景」——它們都沒有阻止 AI 從源頭產生幻覺。

編輯觀點:從產業面來看,視覺幻覺不是「要不要解決」的問題,而是「能不能在悲劇發生前解決」的問題。我認為,未來兩年內,具備視覺推理(visual reasoning)能力的模型會成為主流——不是讓 AI 背更多資料,而是讓它學會「看圖說故事」背後的邏輯關係,而非只是機率分布。換句話說,我們要的不只是會考試的 AI,而是會思考的 AI。但這條路,才剛開始。

下一步:從「預測」走向「推理」

研究人員現已將目光投向更根本的解決方案:從源頭防止 AI 模型產生幻覺,而非在被動偵測。其中最具潛力的方向是視覺推理(visual reasoning)——讓模型分析圖像的幾何結構、物體外觀與空間關係,從而提高其精準度、理解基礎與可解釋性。

這背後的哲學轉折很關鍵:目前的生成式 AI 本質上是「預測引擎」,靠機率在運作。但視覺推理試圖讓 AI 從「統計模仿」走向「結構理解」。說白了,就是要 AI 從背答案的學生,變成真正看懂題目的學生。

話說回來,這條路不會太輕鬆。視覺推理需要更大量的標註資料、更複雜的訓練架構,以及更長的運算時間。但如果不走這條路,我們就必須接受一個事實:AI 的視覺能力,永遠帶有一層不可信賴的機率陰影

你願意把方向盤交給一個會「看走眼」的駕駛嗎?你願意讓一個可能產生幻覺的模型,幫你判讀家人的醫學影像嗎?

如果答案是否定的,那麼我們該追問的就不只是「AI 現在能做什麼」,而是「我們該怎麼讓 AI 學會為自己的輸出負責」。視覺幻覺不是 AI 的盡頭,但它是 AI 從玩具走向工具之前,必須跨過的那道坎。

本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。

常見問題 FAQ

什麼是大型語言模型的「視覺幻覺」?

視覺幻覺是指多模態 AI 在分析圖像時,生成看似合理但實際錯誤或荒謬的輸出,原因是模型基於統計機率而非真實理解來回應。

視覺幻覺對哪些應用領域影響最大?

對自動駕駛車、安全監控影像分析、醫學影像判讀與盲人輔助科技等領域影響最為嚴重,因為這些場景中 AI 的錯誤可能直接威脅人身安全。

目前有什麼方法可以解決 AI 的視覺幻覺問題?

現有方法包括針對特定任務微調模型、導入光達等額外感測器,以及透過 REVERSE 框架進行即時信心評分檢查,但這些方式多屬補救性質,未能從源頭杜絕幻覺。

REVERSE 框架是什麼?

REVERSE 是一種新的驗證框架,能在 AI 生成影像描述的過程中同步檢查幻覺,透過將詞語分類為「自信」或「不自信」並給予信心評分,實現即時修正。

視覺推理和傳統 AI 影像分析有什麼不同?

傳統方法仰賴機率預測,視覺推理則讓模型分析圖像的幾何結構與外觀來提升精準度,目標是讓 AI 從統計模仿走向真正的理解與可解釋性。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

Related Posts