所有文章

把語音辨識當成發音檢查點

2026年10月5日

Choc Education


手機可以在老師走到座位旁以前,就把十秒鐘的英文轉成文字。對下班後準備英文簡報的人來說,這種即時回應很方便。用法要收窄:說一個短句,看看哪個詞變了,修正一個地方,再說一次。轉寫正確,代表訊息成功抵達一位特殊的「聽者」,也就是辨識系統。它無法替口音打及格章。

轉寫結果只是一條線索

自動語音辨識會根據音訊預測最可能的文字。學習者想說three,畫面卻出現free,問題可能出在開頭子音,也可能是母音、麥克風、背景聲,甚至系統對上下文的猜測。畫面能圈出可疑位置,不能獨自完成診斷。

這個界線很實用。辨識錯誤不等於真人一定聽不懂。轉寫全對,也無法證明節奏、語氣與整段說明都容易理解。McCrocklin與Levis整理了語音辨識與發音研究的發展,指出現代系統可以提供可理解度的參考,但不同音、不同回饋設計會產生不同結果。只有一個總分時,學習者往往仍不知道嘴巴該改哪裡。

短而且能重複的句子最適合這項工具。例如:「The third-quarter figures fell by 3.7 percent.」句中有明確目標。若一次錄五分鐘的公司策略說明,文法、選詞、停頓、收音品質與發音全部混在一起,很難找到下一步。

每輪只修一個地方

一次練習可以這樣安排:

  1. 不看稿說出一個完整句子。
  2. 找出系統換掉或漏掉的一個詞。
  3. 聽可靠的範例音檔,選一個看得見或感覺得到的口腔動作。
  4. 回到完整句子,最多再錄兩次。

「說清楚一點」太模糊。可操作的指令會更窄,例如把sheet的母音拉長一些、把cost結尾的子音送出去,或把動詞record的重音移到第二音節。一次同時改三件事,最後也無法判斷是哪個動作產生效果。

McCrocklin在2019年的發音工作坊研究中,比較全程面授與部分使用Windows Speech Recognition練習的課程。結果支持把聽寫軟體當成可取得的練習管道,同時提醒我們:轉寫仍屬間接回饋。後續觀察也發現,學習者會在重錄時換策略,轉寫準確度常隨嘗試提高。到了第三次之後,增加的好處開始縮小。

三次就停。

同一個詞連續失敗時,下一步應交給真人。老師可以聽錄音,同學可以在看不到句子的情況下寫出聽到的內容,學習者也能查有真人錄音的字典。這一步可分辨固定發音問題與偶發的系統誤判。

讓句子保留溝通目的

單獨唸單字容易辨識,卻拿掉了發音在對話中的工作。練習仍要有一個小任務。準備Microsoft Teams會議的人可以說:「Could we move the deadline to Thursday?」大學生可以用32秒解釋英文授課課程中的一張圖。聽者必須取得日期、數量、對比或請求,句子才有傳遞訊息的壓力。

這種設計也能避免一味追求母語口音。目標是讓訊息準確抵達,而且聽者不用費力猜。巧克先前談過保留口音也能讓英文更好懂。語音辨識最合理的用途,是找到fifteen與fifty這類會改變意思的混淆點,修正後立刻回到完整訊息。

四人小班可以兩人共用一台裝置。A錄一句,B看轉寫、聽音訊,指出一個可能的問題。兩人查範例,再交換角色。老師只處理反覆出現、學生無法自行解讀的案例,把專業回饋留給機器說不清楚的地方。

系統也會聽錯

麥克風、房間噪音、口音與話題預測都會改變辨識結果。早期系統理解第二語言語音的能力遠低於真人。現在已改善許多,各種產品與口音之間仍有落差。同一組練習最好固定裝置與房間,避免把收音條件改變誤認成發音進步。

一次成功也不夠。系統可能靠上下文猜中一個發得不完整的詞。把同一個目標放進兩句話,例如「I sent three files」與「Platform three closes early」。兩句都辨識成功,證據較強。結果互相衝突,就把兩段錄音留下來給老師聽。

練習期也要夠長。前述研究整理指出,四週以內的研究很少出現效果,5至8週及9週以上的計畫較有機會看到改善。這不代表每天要對著聽寫軟體說四十分鐘。每週三天、每次六分鐘,持續追一個反覆出現的特徵,已能累積可比較的紀錄。

我偏好很樸素的表格:日期、目標片語、第一次轉寫、採用的調整、最後一次轉寫,不放百分比分數。累積17筆之後,老師與學習者會看出結尾子音、數字對比或單字重音是否一直回來。隔天先錄一句包含該特徵的英文,錄完一次才讓軟體提示。