科技

大型語言模型現「視覺幻覺」 學者憂 AI 可靠性挑戰應用

Vendor Icon

商傳媒

7 小時前


商傳媒|林昭衡/綜合外電報導

隨著人工智慧技術快速發展,OpenAI 的 ChatGPT 和 Anthropic 的 Claude 等大型語言模型(LLMs)已進化為多模態 AI,不僅能處理文字,還能分析圖像,甚至從文字描述生成圖片。然而,學術界對此一進步也提出擔憂,指出這些模型存在「視覺幻覺」(Visual Hallucinations)問題,即 AI 在圖像處理過程中可能生成看似合理但實際錯誤或荒謬的輸出。

根據知名學術期刊《Communications of the ACM》的報導,諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 指出,LLMs 經過大量文本與影像資料訓練,由於缺乏對「真理」的明確規範,其輸出往往僅具統計學上的合理性,而非真實。加州柏克萊人工智慧研究實驗室(University of California Berkeley Artificial Intelligence Research lab, BAIR)的博士後研究員 David Chan 也提到,儘管人類也會有類似錯誤,但大眾期望 AI 模型的表現應優於人類。

「視覺幻覺」對自動駕駛車與安全監控影像分析等關鍵應用領域構成嚴重挑戰,可能損害大眾對 AI 的信任度。例如,當背景資訊與圖像內容矛盾時,幻覺現象會更頻繁。Michael Pound 舉例說明,醫學影像分析若受其他病患資料影響,AI 可能因此忽略圖像中實際存在的疾病跡象。他強調,對於盲人輔助科技等使用者無法自行驗證輸出的情境,AI 模型的精確度至關重要,任何錯誤都可能帶來風險。

研究人員正積極探討視覺幻覺的根本成因,認為這與生成式 AI 模型作為仰賴機率的「預測引擎」本質息息相關。目前,除了針對特定任務的影像資料進行模型微調(fine-tuning),並在如自動駕駛車中導入光達(LiDAR)等多餘感測器以彌補錯誤外,現有的後驗證(post-hoc verification)方法也面臨效率低落的問題,因為它需要額外的 AI 模型來檢查輸出,過程緩慢且僅能拒絕錯誤回應,無法直接修正。

為提升驗證效率,新的「REVERSE 框架」被提出,它能在 AI 生成回應的過程中同步檢查幻覺。此框架透過訓練模型將詞語分類為「自信」或「不自信」,並在生成影像描述時給予每個詞彙信心評分,從而實現即時修正。David Chan 形容這是一種「推論技巧」,能讓部署中的系統根據預期的錯誤率來進行應對。未來研究則將聚焦於從源頭防止 AI 模型產生幻覺,並探索視覺推理(visual reasoning)而非純文本推理,透過讓模型分析圖像的幾何與外觀,來提高其精準度、理解基礎及可解釋性。


author avatar
商傳媒
商傳媒是由一群在媒體界超過十年的採訪團隊,是一個提供財經、科技、智慧製造、醫療、電玩資訊為主要服務內容的金融科技網路媒體,其宗旨在於提供台灣中小企業一個產品新聞的平台,未來更朝向將台灣中小企業產品獎持續推向全世界。
donate plan

充電計畫

喜歡這篇文章嗎?歡迎幫作者充電,好內容值得更多人支持

瞭解詳情