
商傳媒|林昭衡/綜合外電報導
隨著人工智慧(AI)技術快速發展,各種AI模型如雨後春筍般湧現,造成「模型激增」的現象,意即市面上AI模型的數量與種類快速增加,讓企業在選擇與導入合適模型時面臨巨大挑戰。為此,一種新型態的「AI評估公司」(AI Evaluation Firms)正嶄露頭角,扮演起類似「產業裁判」的角色,為AI模型的性能、速度與成本提供客觀的評鑑標準。根據Precedence Research估計,全球AI模型評估與基準測試工具市場規模,預計將從今年的14.2億美元成長至2035年的95.7億美元。
Artificial Analysis是由前麥肯錫顧問Mika Hilsmith與軟體工程師George Cameron共同創立。Hilsmith於2023年開發AI法律搜尋服務時,發現市場缺乏一個能夠集中比較模型準確度、速度與定價的資源,因此催生了創立該公司的想法。他們隨後於2024年1月推出了直接測試主流AI模型的比較儀表板服務。目前,Artificial Analysis已能評估超過600個模型。
該公司的旗艦產品「Artificial Index」整合了智慧代理評估(實用任務與工具使用)、程式開發、科學推論以及通用能力等四大類,透過九項測試進行評分,並將結果轉換為100分制。其中,智慧代理評估佔比34%,程式開發與科學推論各佔24%,通用能力則佔18%。許多AI業者現在會將其模型在Artificial Index上的排名視為一項重要成就。Artificial Analysis主要透過向AI公司銷售詳細數據和客製化評估服務來獲利。
另一個受到關注的評估平台是Arena,它源自加州大學柏克萊分校(UC Berkeley)的Chatbot Arena研究專案。Arena透過讓使用者在匿名的AI回應中進行選擇,反映真實世界的使用者偏好來進行模型排名。目前,Arena擁有超過500萬名月活躍用戶與每月6000萬次對話,其估值已從去年5月的6億美元,大幅躍升至今年1月的17億美元。Arena也藉由向AI開發者提供付費效能分析服務來創造營收。
除了商業公司,Epoch AI和METR等非營利研究機構也在AI模型評估生態系中扮演重要角色,主要分析AI模型訓練所需的運算資源與性能趨勢。儘管如此,AI產業仍存在挑戰,有產業人士指出,獨立評估機構設立通用標準固然重要,但若開發目標僅專注於特定的測試分數,可能會導致產業過度優化考試表現,而非實際應用能力。此外,Arena也曾因允許大型AI公司重複測試未發布模型而引發批評,被認為這類作法可能讓大型公司在產品上市前篩選出高分模型,導致小型公司處於劣勢。

