Oralion

為什麼降噪有時反而降低了語音辨識率?從 ASR 的角度重新理解 Speech Enhancement

在語音辨識領域,「先降噪,再送進 ASR」幾乎是一個理所當然的流程。原因也很直觀:背景噪音越少,人耳越容易聽清楚,語音辨識模型理應也更容易理解內容。

然而,實際情況並不總是如此。

近年來,越來越多研究以及大量實際測試發現,對於現代大型語音辨識模型而言,某些降噪模型不但沒有降低辨識錯誤率,反而可能讓 Word Error Rate(WER)或 Character Error Rate(CER)上升。也就是說,音訊聽起來更乾淨了,但辨識結果卻變得更差。

造成這個現象的原因,並不是降噪技術不夠成熟,而是 Speech Enhancement(SE)與 Automatic Speech Recognition(ASR)從一開始就在解決不同的問題。


一、Speech Enhancement 與 ASR,追求的是不同的目標

大部分降噪模型的設計目標,是改善人耳的聆聽體驗,因此訓練時通常會以 PESQ、STOI、DNSMOS 等音質評估指標作為最佳化方向;ASR 則完全不同,它最終關心的是能否正確還原語音內容,因此真正重要的是 WER、CER,以及語音特徵是否仍然保持可辨識性。

兩者的關注重點其實並不相同:

Speech Enhancement 關注的是:

  • 人耳聽起來是否自然、舒服。
  • 背景噪音是否足夠安靜。
  • 是否提升 PESQ、STOI、DNSMOS 等音質分數。
  • 即使犧牲部分語音細節,只要整體聽感變好,通常仍會得到較高評價。

Automatic Speech Recognition 關注的是:

  • 能否正確辨識文字內容。
  • 語音頻譜是否仍保留足夠的音素資訊。
  • WER、CER 是否下降。
  • 對背景噪音通常具有一定容忍度,但對人工失真(Artifact)非常敏感。

這也是許多人容易忽略的一點:ASR 並不追求最好聽的聲音,而是最容易辨識的聲音。

背景噪音確實可能影響辨識,但只要語音的關鍵特徵仍然完整保留,現代 ASR 通常具有相當程度的容忍能力。相反地,如果降噪過程改變了語音本身的特徵,即使背景變得更安靜,也可能造成辨識率下降。


二、真正的問題不是噪音,而是 Distribution Shift

現代大型 ASR 多半不是直接分析原始波形,而是先將音訊轉換為 Log-Mel Spectrogram 等頻譜特徵,再交由神經網路進行辨識。

這些模型是在大量真實錄音資料上完成訓練,因此學習到的是各種實際錄音環境所形成的資料分布,而不是理想化、完全沒有噪音的錄音。

如果前端降噪模型改變了語音頻譜,即使人耳幾乎察覺不到,對 ASR 而言,輸入資料可能已經偏離了模型熟悉的分布(Out-of-Distribution)。

這種現象稱為 Distribution Shift

許多神經網路降噪模型在去除背景噪音的同時,也會重新塑造語音頻譜,例如:

  • 調整高頻能量。
  • 平滑頻譜細節。
  • 改變部分共振峰(Formant)。
  • 利用生成式方法補足原本不存在的訊號。

這些變化對人耳而言通常十分自然,但對 ASR 而言,卻可能破壞區分不同音素所依賴的重要特徵。

因此,真正影響辨識率的,往往不是殘留多少背景噪音,而是降噪過程是否改變了模型原本熟悉的語音特徵。


三、過度降噪容易誤傷真正重要的語音資訊

在實際應用中,最常見的問題是高頻資訊被一併削弱。

許多降噪模型為了追求更乾淨的背景,會對高頻能量進行較強的抑制。然而,高頻也是許多摩擦音與破擦音最重要的資訊來源,例如:

  • 中文的「s」、「sh」、「ch」、「zh」。
  • 英文的 /s/、/f/、/θ/ 等音素。

這些聲音在頻譜上的表現,本來就與風聲、氣流聲等背景噪音有一定程度的相似性。如果降噪模型無法準確區分兩者,就可能把真正的語音資訊一起消除。

人耳仍然可以依靠上下文推測內容,因此往往感覺不到太大的差異;但 ASR 缺少了這些高頻邊界資訊後,就更容易混淆相近音素,最終反映在 CER 或 WER 的上升。

因此,不少測試都會出現一個有趣的現象:

音訊品質持續提升,但辨識率卻在某個階段開始下降。


四、現代大型 ASR 已經把噪音視為訓練資料的一部分

近年來的大型語音辨識模型,大多是在大量真實世界錄音上完成訓練。這些資料涵蓋不同的錄音設備、環境噪音、回音、多人對話,以及各種品質不一的麥克風,因此模型在訓練過程中,已經學會如何在背景噪音存在的情況下提取穩定的語音特徵。

換句話說,背景噪音本身通常就是訓練資料的一部分,而不是必須完全消除的異常情況。

因此,前端降噪未必能帶來額外收益。如果降噪模型改變了語音頻譜,例如:

  • 重新分配頻率能量。
  • 削弱高頻資訊。
  • 引入新的人工失真(Artifact)。
  • 改變語音原本的頻譜結構。

就可能使輸入特徵偏離模型訓練時所熟悉的資料分布。即使背景變得更乾淨,辨識率也未必會提升,甚至可能下降。

因此,評估降噪效果時,不應只觀察音訊是否變乾淨,而必須直接量測 ASR 的實際辨識表現。


五、選擇降噪模型時,應該以 ASR 表現作為依據

在語音辨識系統中,沒有任何一種降噪模型適用於所有情境。

不同模型的設計理念各不相同:

  • 有些追求最大的背景抑制能力。
  • 有些刻意保留更多原始語音細節。
  • 有些適合語音通話。
  • 有些適合錄音修復。
  • 有些則更適合即時串流。

因此,評估一個降噪模型是否適合 ASR,不應只比較 PESQ、DNSMOS 等音質分數,而應直接觀察它對辨識率的影響,包括:

  • WER
  • CER
  • Latency(延遲)
  • CPU / GPU 使用率
  • 長時間串流穩定性

實際上,不同 ASR 模型對同一個降噪前端的反應也可能不同。某個模型能帶來辨識率提升,不代表換成另一個 ASR 後仍然有效。

不存在所謂「最好的降噪模型」,只有「最適合特定 ASR 系統的降噪模型」。


結語

Speech Enhancement 的目的,不應只是讓音訊變得更乾淨,而是讓後續的語音辨識更可靠。

對現代大型 ASR 而言,背景噪音未必是真正的敵人;真正需要避免的,是降噪過程對語音特徵造成的改變。當輸入資料偏離模型熟悉的分布,即使人耳聽起來更舒服,也可能讓辨識率下降。

因此,在設計語音辨識系統時,降噪不應被視為固定的前處理流程,而應作為整個 ASR Pipeline 的一部分來評估。只有當它能夠在實際測試中降低 WER 或 CER,而不是僅改善聽感時,才真正為系統帶來價值。

對 ASR 而言,最重要的從來不是最安靜的音訊,而是保留最多有效語音資訊的音訊。

51760135-E425-4D98-8DC3-F2949FCCC7AF