🎧 語音增強 / 去噪 (Speech Enhancement)

從噪音中提取純淨人聲 · DCCRN・Meta Denoiser・9MB 極致輕量

作者TonTon Huang Ph.D.投入時間:~150 天 (2020/08–2021/01)|更新:2026-07-28

語音增強(Speech Enhancement / Denoising)的目標是:從含雜訊的複雜環境音中,精準提取出純淨的人聲。這在 ASR 前處理中是決定辨識率成敗的關鍵第一步。概念上類似語者分離——差別在於去噪是把「非人聲」的頻段過濾掉,而不是把多個人聲拆開。

💡 起源:這個專案起源是在 Facebook 上看到圖靈獎得主 Yann LeCun 分享 FAIR 的最新研究,腦洞大開就跳坑了!

9 MB
最終模型大小
0.08
Real Time Factor
~150 天
研發投入
+20%
下游 ASR 辨識率提升
#語音增強 #DCCRN #MetaDenoiser #ClearVoice #NovaSR #PESQ

TasNet → DEMUCS → Meta Denoiser

TasNet
LSTM Separator
Conv-TasNet
TCN 取代 LSTM
DEMUCS
LSTM + U-Net Skip
Facebook Denoiser
單聲道即時去噪

DEMUCS 原本為音樂分離設計,Facebook Denoiser 將其改造為端到端語音增強:雙 U-Net 輸出摺疊為單通道、加入 Linear 層、並以 LSTM 負責長距離依賴。其關鍵特性是可在 CPU 即時執行,是最適合邊緣部署的基礎架構。

六大主流去噪模型

🏆 DCCRN (Deep Complex Convolutional Recurrent Network, 2020)
Interspeech 2020 Deep Noise Suppression Challenge 🥇 第一名 | arXiv:2008.00264
複數值卷積 + LSTM,透過 STFT/iSTFT 處理頻域複數特徵。同時對幅度與相位進行聯合估計,是目前工業界最受歡迎的去噪架構之一。
📘 Facebook Meta Denoiser (2020)
基於 DEMUCS 的端到端架構,LSTM + U-Net Skip Connection,CPU 即時執行。本專案選用的基礎架構,最終煉出 9MB / RTF=0.08 的輕量版。
📗 Phase-aware Deep Complex U-Net (2019)
DEMAND PESQ 排行榜 🥇 第一 (large) / 🥉 第三 (base)
引入複數特徵表示,使用 weighted-SDR loss 同時優化幅度與相位。首次在 U-Net 架構中系統性處理相位資訊,奠定後續複數域模型基礎。
📙 RHRNET (2019)
DEMAND PESQ 🥈 第二名 | arXiv:1904.07294
多層 GRU + 殘差設計,用 reshape 取代 upsampling。⚠️ 7 層 GRU 計算量大,且無開放源碼,難以直接復現。
📕 RNNoise (Mozilla)
輕量混合架構 | GitHub
22 個 Bark 頻帶 + 42 個輸入特徵 + GRU。非端到端,結合傳統訊號處理(OMLSA/IMCRA)。優點是極度輕量;缺點是對複雜噪音類型處理能力有限。
🆕 ClearVoice (阿里, 2024-12)
阿里開源的一站式語音處理工具,同時整合語音增強與語者分離,能對付極度棘手的雞尾酒會效應。推薦用於多人視訊會議音訊後處理。

數據「煉丹」的眉角

✅ 數據生成簡單:去噪任務的數據集相對好處理!網路上到處能找到乾淨語音(LibriSpeech、AISHELL)與純噪音(ESC-50、MUSAN),用程式動態 Mix 可無限生成訓練數據。
⚠️ 中文去噪的陷阱:如果訓練數據全是英文語音,模型對中文語音的去噪效果會明顯偏差。Mix 時必須加入大量中文語料(如 AISHELL 系列)。
⚠️ 多通道音訊陷阱:scipy 讀取音訊 shape 是 (length, channels),而 torchaudio 是 (channels, length),需要做 transpose;且 PCM 格式不帶通道數 metadata,需手動 reshape。
⚠️ SEANet (Google, 2020) 的隱藏限制:表現優異,但需要額外的骨導加速度計 (bone conduction accelerometer) 輸入訊號,一般麥克風部署場景無法直接使用。

音訊超解析與音質提升

🆕 NovaSR (2026-04)
52KB 的微型音訊超解析模型,將 16kHz「電話級」音質升頻為 48kHz Hi-Fi 全頻帶。A100 上高達 3600 倍實時速度,手機 CPU 上也幾乎零延遲。適合嵌入 TWS 藍牙耳機晶片或 TTS 輸出後處理。

實戰選型

✅ 生產推薦管線:UVR5(人聲/背景音分離)→ DCCRN 或 Meta Denoiser(去噪)→ Whisper / FunASR(ASR)→ pycorrector(文字糾錯)。一個完美的語音系統從來不是靠一個大模型就能搞定的。
✅ 邊緣部署:Meta Denoiser(9MB 優化版)RNNoise;CPU 即時執行,RTF 0.08 代表 1 秒運算可處理超過 12 秒音訊。
✅ 多人場景:直接使用 ClearVoice,增強與分離一次搞定,免去多模型串聯的複雜度。
✅ 音質升頻需求:若需要將錄音室以外的電話品質語音提升為高保真,加入 NovaSR(52KB)做後處理幾乎零成本。
🎧

繼續探索語音處理其他主題