科技

Google Gemini 3.5 Transcribe登場 語音辨識錯誤率創新低

Vendor Icon

商傳媒

2 小時前

圖/示意圖

商傳媒|林昭衡/綜合外電報導

Google 今日發表全新人工智慧模型 Gemini 3.5 Transcribe,這項語音轉文字技術旨在大幅提升語音輸入的效率,不僅能自動過濾使用者口語中的贅詞(如「嗯」、「啊」),還能即時校正語音內容,產出精煉的 AI 文字。這款新模型在 AI 語音辨識技術上取得顯著突破,與前一代語音引擎 Chirp 3 相比,語音轉文字的速度預計可提升約七成,即時語音辨識的錯誤率更從 Chirp 3 的 7.32% 降低至 5.5%。

Gemini 3.5 Transcribe 的關鍵功能包含在辨識過程中,即時移除常見的口頭禪與修正語句,同時也能參考使用者提供的專屬詞彙表,精準處理特定領域的「專業術語」。這項技術支援 85 種語言,並能處理最多三位發言者的預錄音檔。

目前,Gemini 3.5 Transcribe 已整合至多項 Google 產品中。例如,Pixel 11 手機上的 Gboard 輸入法已內建「Rambler」功能,利用此模型提供更流暢的語音輸入體驗。Google 表示,今年稍晚會將 Rambler 擴展至更多 Gemini Intelligence 裝置。此外,Gemini app 的 macOS 版本、Antigravity 平台以及 AI Studio 的模型建構工具,也於昨日起開始支援 Gemini 3.5 Transcribe,讓開發人員能運用此語音辨識技術進行「vibe code」應用程式開發。開發者也能透過 Gemini API 存取這項新模型。Google 也規劃將此 AI 轉錄功能導入 Chrome 瀏覽器,預計將很快提供,屆時使用者可透過語音在任何網頁欄位輸入文字,例如撰寫電子郵件、發表評論,甚至以語音與 AI 聊天機器人互動。


author avatar
商傳媒
商傳媒是由一群在媒體界超過十年的採訪團隊,是一個提供財經、科技、智慧製造、醫療、電玩資訊為主要服務內容的金融科技網路媒體,其宗旨在於提供台灣中小企業一個產品新聞的平台,未來更朝向將台灣中小企業產品獎持續推向全世界。
donate plan

充電計畫

喜歡這篇文章嗎?歡迎幫作者充電,好內容值得更多人支持

瞭解詳情