这条路线可以先抓住一个问题:多麦克风录音里有空间信息,神经网络应该怎样用它?

西湖大学李晓飞老师相关工作的主线不是绕开信号处理,而是保留 STFT 这个坐标系。固定一个频率 ,模型看到的是不同时间、不同麦克风上的复数观测:

是麦克风数, 是时间帧。传统多通道方法经常按频率估计相位差、协方差矩阵或空间滤波器;窄带深度学习沿用这个观察方式,只是把手工规则换成网络学习。

阅读这条路线时,不要只记模型名字。每篇论文都可以按同一组问题读:

  • 它解决的是降噪、分离、去混响,还是联合增强?
  • 输入是单通道还是多通道?是波形还是 STFT?
  • 网络主要在时间、频率、通道、空间哪几个维度上建模?
  • 输出是 mask、复数谱,还是空间滤波器?
  • 训练时怎样处理多说话人排列问题?

下面按时间线展开。中间会插入一篇 Conformer 背景论文,因为 NBC/NBC2 的结构需要先理解这个骨干。

阅读前先统一流程

深度学习语音增强和分离通常可以放进这条流水线:

1
Input -> Encoder -> Separator -> Audio Estimation -> Decoder -> Output

编码器、分离器、音频估计和解码器框架

这里的 Encoder 不一定是可学习网络。STFT 也是一种编码器,iSTFT 就是对应的解码器。Separator 是中间真正建模的部分,Audio Estimation 则决定网络最后输出什么:幅度比例、复数谱、空间滤波器,或者直接输出时域波形。

常用符号先统一一下:

符号 含义
时间帧数
频率格点数
麦克风通道数
目标说话人或目标语音流数量
个麦克风在时间帧 、频率 上的混合 STFT
估计出的目标语音 STFT

2019 | 子带 LSTM:把多通道降噪放进窄带坐标

■ 基本信息:

  • 论文英文原名:Multichannel Speech Enhancement Based on Time-Frequency Masking Using Subband Long Short-Term Memory
  • 中文翻译:(基于子带长短期记忆网络时频掩蔽的多通道语音增强)
  • 发表年份:2019
  • 作者信息:Xiaofei Li, Radu Horaud
  • 所属单位:INRIA Grenoble Rhone-Alpes, France

■ 核心任务:

  • 解决多通道语音增强里的降噪问题;输入是多麦克风噪声语音,目标是增强参考通道语音,不处理多人分离,也不把去混响作为核心任务。

■ 研究动机:

  • 传统方法/前人工作不足:
    • 传统多通道增强常在窄带频率上处理空间信息,但深度学习增强多使用全频带谱特征,计算和泛化都不够理想。
    • 全频带模型容易学习训练集里的说话人和噪声频谱模式,遇到未见过的说话人或噪声时可能退化。
    • 只做单通道谱映射时,很难利用麦克风之间的相干性、时间差和相位差。
  • 本文探索动机:
    • 固定一个频率,让同一个 LSTM 在所有频率上共享参数,沿时间学习语音和噪声的差异。
    • 语音通常非平稳且跨通道相干,噪声相对平稳且空间相关性弱;窄带 LSTM 正是利用这个差异。
    • 这样做能减少模型对全频带谱形状的依赖,提高对新说话人、新噪声的泛化能力。

■ 网络具体结构:

  • 核心是两层堆叠的 LSTM 或 BLSTM,后接一个全连接层。
  • LSTM 沿时间处理某一个频率上的多通道 STFT 序列。
  • 论文比较了单向 LSTM 和双向 BLSTM。BLSTM 能看未来帧,适合离线增强;单向 LSTM 更接近在线处理,但上下文较少。
  • 这个网络不是每个频率训练一个模型,而是所有频率共享同一套网络参数。

子带 LSTM 结构

■ 模型输入:

  • 输入是单一频率 下多个麦克风观测信号的 STFT 系数序列。
  • 对每个时间帧,把所有通道的实部和虚部拼成一个向量:
  • 输入会用参考通道幅度均值做归一化,避免不同响度样本带来的数值尺度差异。

■ 模型输出:

  • 输出物理意义:参考通道目标语音的幅度比掩码 MRM,也就是每个时间帧上目标幅度应该保留多少。
  • 激活函数:Sigmoid。
  • 输出范围:
  • 固定频率下的维度:
  • 使用方式:把 MRM 乘到混合语音参考通道的幅度谱上,相位通常仍使用混合语音相位。

■ 实验设置:

  • 数据集:5 麦克风 CHiME3 真实录音数据,用于多通道噪声环境下的增强评测。
  • 评价指标:
    • PESQ,Perceptual Evaluation of Speech Quality,语音质量感知评估,越高越好。
    • STOI,Short-Time Objective Intelligibility,短时客观可懂度,越高越好。

■ 展望与总结:

  • 这篇论文给后续工作的起点很清楚:多通道深度学习不一定要从全频带谱图开始,可以固定频率,沿时间学习空间线索。
  • 它的限制也明显:输出仍是幅度 mask,不直接估计相位;任务主要是降噪,没有进入多说话人分离和去混响。

2020 | 窄带深度滤波:从 mask 走向复数谱和空间滤波器

■ 基本信息:

  • 论文英文原名:Narrow-Band Deep Filtering for Multichannel Speech Enhancement
  • 中文翻译:(用于多通道语音增强的窄带深度滤波)
  • 发表年份:2020
  • 作者信息:Xiaofei Li, Radu Horaud
  • 所属单位:Westlake University, China;Inria Grenoble Rhone-Alpes and Univ. Grenoble Alpes, France

■ 核心任务:

  • 解决多通道语音增强里的降噪问题;仍以多麦克风噪声语音为输入,不处理多人分离,主要不讨论去混响。

■ 研究动机:

  • 传统方法/前人工作不足:
    • 只预测 MRM 时,模型主要改变幅度,不能直接恢复干净语音的复数谱。
    • 多通道增强的关键不只是保留多少频谱能量,还包括不同麦克风通道应该怎样组合。
    • 传统空间滤波有清楚物理意义,但手工估计滤波器在复杂噪声下不够灵活。
  • 本文探索动机:
    • 保留 2019 年的窄带 LSTM 思路,但把网络输出目标扩展为三类:MRM、复数系数 CC、空间滤波器 SF/SSF。
    • 用同一个窄带网络同时探索幅度掩蔽、复数谱直接估计和空间滤波三种方式。

■ 网络具体结构:

  • 主干仍是两层堆叠的 LSTM 或 BLSTM,后接全连接层。
  • 网络固定一个频率,沿时间处理多通道 STFT 序列,所有频率共享参数。
  • 相比 2019 年,结构本身变化不大,关键变化在 Audio Estimation 输出头。

子带 LSTM 结构

■ 模型输入:

  • 输入是单一频率下多个麦克风观测信号的 STFT 复数系数。
  • 每个通道都提供实部和虚部;固定频率时,输入可以看成一个随时间变化的多通道复数序列。

■ 模型输出:

  • MRM,幅度比掩码:
    • 物理意义:预测参考通道目标语音幅度相对混合幅度的保留比例。
    • 激活函数:Sigmoid。
    • 维度:
  • CC,Complex Coefficient,复数 STFT 系数:
    • 物理意义:直接预测参考通道干净语音 STFT 的实部和虚部。
    • 激活函数:Identity,不限制输出范围。
    • 维度:
  • SF/SSF,Spatial Filter / Smoothed Spatial Filter,空间滤波器:
    • 物理意义:为每个麦克风通道预测一个复数滤波权重,再把多通道观测加权合成目标语音。
    • 激活函数:Tanh。
    • 维度:,其中 是麦克风通道数,2 对应实部和虚部。

■ 实验设置:

  • 数据集:4 麦克风 CHiME4 真实数据,同时包含人工加噪混合信号和现场录音。
  • 评价指标:
    • PESQ,感知语音质量,越高越好。
    • STOI,短时客观可懂度,越高越好。
    • SDR,信号失真比,越高越好。
    • SRMR,Speech-to-Reverberation Modulation Energy Ratio,无参考语音质量/混响相关指标,越高越好。
    • WER,词错误率,用后端 DNN-HMM ASR 系统评估,越低越好。

■ 展望与总结:

  • 这篇论文把“窄带网络能输出什么”讲清楚了。MRM 是掩蔽,CC 是复数谱直接估计,SF/SSF 则把网络输出和传统空间滤波连接起来。
  • 后续自然问题是:窄带模型缺少跨频率身份和语义联系,怎样把窄带信息和全频带信息融合起来?
  • 另一条延伸是把增强前端和 ASR 后端联合训练,让增强目标不只服务听感,也服务识别。

2022 | NBSS:用 fPIT 解决窄带多人分离的频率错排

■ 基本信息:

  • 论文英文原名:Multi-Channel Narrow-Band Deep Speech Separation with Full-Band Permutation Invariant Training
  • 中文翻译:(结合全频带排列不变训练的多通道窄带深度语音分离)
  • 发表年份:2022
  • 作者信息:Changsheng Quan, Xiaofei Li
  • 所属单位:Zhejiang University;Westlake University & Westlake Institute for Advanced Study

■ 核心任务:

  • 解决多通道多说话人语音分离;重点是把多个说话人从多麦克风混合语音中拆开,不以降噪和去混响为主要目标。

■ 研究动机:

  • 传统方法/前人工作不足:
    • 窄带方法可以利用空间向量和通道间差异,但每个频率独立处理会出现频率错排。
    • 频率错排的意思是:低频里的输出 1 可能对应说话人 A,高频里的输出 1 却可能对应说话人 B。拼回波形后,身份会混在一起。
    • 单频率上的 PIT 只能解决当前频率的输出顺序,不能保证全频带一致。
  • 本文探索动机:
    • 保留窄带网络对空间信息的利用能力。
    • 用 full-band PIT 从全频带角度选择排列,让同一个输出在所有频率上尽量对应同一个说话人。损失在重组后的完整频带结果上选择整段语音级的最优排列。

■ 网络具体结构:

  • 主体仍接近前两篇的窄带序列网络:固定一个频率,沿时间处理多通道 STFT。
  • 网络共享于所有频率,每个频率都输出多个目标说话人的复数谱。
  • 训练阶段把所有频率的输出重新组合成完整语音,再用 fPIT 计算最优排列和损失。

NBSS 窄带分离结构

图中的窄带序列模块是主要的可学习部分,也可以替换为其他序列建模骨干。

NBSS 可替换的序列建模骨干

■ 模型输入:

  • 输入是单一频率下多麦克风混合语音的 STFT 系数。
  • 固定频率时,模型看到的是随时间变化的多通道复数观测;每个时间帧中包含多个麦克风的实部和虚部。

■ 模型输出:

  • 输出物理意义: 个目标说话人在参考通道上的纯净语音空间图像的复数 STFT 系数。
  • 激活函数:按复数谱连续值直接回归,可理解为 Identity,不使用 Sigmoid 或 Tanh 限幅。
  • 固定频率下的维度:,其中 对应每个目标的实部和虚部。
  • 输出再经过逆归一化、跨频率重组和 iSTFT,得到分离后的时域语音。

■ 实验设置:

  • 数据集:Spatialized WSJ0-2mix,空间化双说话人混合数据,用于多通道分离。
  • 评价指标:
    • NB-PESQ,窄带感知语音质量,越高越好。
    • WB-PESQ,宽带感知语音质量,越高越好。
    • SDR,信号失真比,越高越好。
    • SI-SDR,尺度不变信号失真比,越高越好,也是分离任务常用优化目标。

■ 展望与总结:

  • NBSS 把窄带深度学习从单目标增强推进到多人分离。
  • 这篇论文最关键的不是换了一个网络,而是提出了 fPIT 这类全频带训练约束,让窄带输出能拼回一致的说话人。
  • 局限是计算仍然重,频率独立处理和跨频率协调之间还需要更强的结构。

2020 背景 | Conformer:为什么后面会用注意力和卷积组合

■ 基本信息:

  • 论文英文原名:Conformer: Convolution-augmented Transformer for Speech Recognition
  • 中文翻译:(Conformer:基于卷积增强型 Transformer 的语音识别)
  • 发表年份:2020
  • 作者信息:Anmol Gulati, James Qin, Chung-Cheng Chiu 等
  • 所属单位:Google Inc.

■ 核心任务:

  • 解决端到端自动语音识别问题;输入是语音特征,输出是文本序列。它本身不是语音增强论文,但为后面的 NBC/NBC2 提供了网络结构背景。

■ 研究动机:

  • 传统方法/前人工作不足:
    • Transformer 的 self-attention 擅长长距离全局交互,但局部细节建模较弱。
    • CNN 擅长提取局部模式,但要看很远上下文时需要更深网络。
  • 本文探索动机:
    • 把 self-attention 和 convolution 放进同一个 block,同时处理全局依赖和局部语音模式。

■ 网络具体结构:

  • 前端使用卷积下采样层压缩时间和频率维。
  • 主体堆叠多个 Conformer block。
  • 每个 block 采用 Macaron-style 结构:前馈网络、带相对位置编码的多头自注意力、卷积模块、前馈网络。
  • 卷积模块通常包含逐点卷积、GLU 门控、一维深度可分离卷积、归一化和 Swish 激活。

Conformer block

■ 模型输入:

  • 输入是对数梅尔谱等 ASR 常用声学特征。
  • 典型形状可以理解为 ,其中 80 是梅尔频带数。

■ 模型输出:

  • 输出物理意义:文本词元或字符/子词概率分布。
  • 激活函数:末端通常经过 softmax 得到词元概率。
  • 维度:与词表大小和时间解码步数有关,不对应 这类语音增强输出维度。

■ 实验设置:

  • 数据集:原论文在语音识别数据集上评测,不属于这条语音增强路线的核心实验。
  • 评价指标:
    • WER,词错误率,越低越好。

■ 展望与总结:

  • 对西湖大学路线而言,Conformer 的意义在于提供了一个适合语音序列的骨干:attention 看长程关系,convolution 看局部变化。
  • NBC 把这个结构搬到窄带多通道分离里,用 self-attention 处理空间向量聚类的相似性问题。

2022 | NBC:用窄带 Conformer 做多通道分离

■ 基本信息:

  • 论文英文原名:Multichannel Speech Separation with Narrow-Band Conformer
  • 中文翻译:(基于窄带 Conformer 的多通道语音分离)
  • 发表年份:2022
  • 作者信息:Changsheng Quan, Xiaofei Li
  • 所属单位:Zhejiang University;Westlake University & Westlake Institute for Advanced Study

■ 核心任务:

  • 解决多通道多说话人语音分离;输入是多麦克风混合语音,输出是多个说话人的分离语音,不以降噪和去混响为主要目标。

■ 研究动机:

  • 传统方法/前人工作不足:
    • NBSS 证明窄带深度分离可行,但 LSTM/BLSTM 对长时间关系和空间向量聚类的表达还不够强。
    • 多通道分离依赖同一声源的空间向量相似性,传统聚类和 beamforming 需要显式设计规则。
  • 本文探索动机:
    • self-attention 本质上会计算向量相似度并聚合相关信息,这和“把同一说话人的空间向量聚起来”很接近。
    • Conformer 同时有 attention 和 convolution,适合处理长程说话人线索和局部平滑。

■ 网络具体结构:

  • 提出 Narrow-Band Conformer,简称 NBC。
  • 每个频率独立输入网络,所有频率共享同一个 NBC。
  • NBC block 用 self-attention 聚合相似空间向量,用卷积前馈模块做局部平滑和混响相关处理。
  • 训练仍使用 fPIT,保证跨频率的说话人顺序一致。
    窄带深度语音分离框架

窄带 Conformer block

■ 模型输入:

  • 输入是单一频率下多麦克风混合语音的 STFT 复数系数。
  • 一个时间帧上的输入可以看成多个麦克风复数观测的拼接。

■ 模型输出:

  • 输出物理意义: 个目标说话人在参考通道上的纯净语音空间图像复数 STFT。
  • 激活函数:按复数谱连续值直接回归,可理解为 Identity。
  • 固定频率下的维度:
  • 输出经过跨频率排列对齐、重组和 iSTFT 变成多路分离波形。

■ 实验设置:

  • 数据集:人工合成的 Spatialized WSJ0-2mix;使用 gpuRIR 模拟 8 麦克风圆形阵列,半径约 5 cm,2 个说话人随机比例重叠,RT60 覆盖
  • 评价指标:
    • NB-PESQ,越高越好。
    • WB-PESQ,越高越好。
    • SI-SDR,越高越好。
    • RTF,Real-Time Factor,计算实时率,越低越好。

■ 展望与总结:

  • NBC 把空间向量聚类和 self-attention 联系起来,这条路线也由 RNN 逐渐转向注意力结构。
  • 主要问题是计算量。按频率独立运行网络会让 RTF 偏高,论文记录中 RTF 约为 ,距离实时处理还有距离。

2022 | NBC2:重新整理窄带 Conformer 的归一化和频率结构

■ 基本信息:

  • 论文英文原名:NBC2: Multichannel Speech Separation with Revised Narrow-Band Conformer
  • 中文翻译:(NBC2:基于改进版窄带 Conformer 的多通道语音分离)
  • 发表年份:2022
  • 作者信息:Changsheng Quan, Xiaofei Li
  • 所属单位:Zhejiang University;Westlake University & Westlake Institute for Advanced Study

■ 核心任务:

  • 解决多通道多说话人语音分离;任务边界与 NBC 接近,重点仍是分离,不是联合降噪和去混响。

■ 研究动机:

  • 传统方法/前人工作不足:
    • NBC 已经引入 Conformer,但普通归一化方法可能破坏窄带模型里的频率分布结构。
    • 每个频率的空间相位关系不同,简单把频率当成普通特征维一起归一化,可能削弱空间线索。
    • 原始 NBC 计算仍重,结构还需要更适合窄带处理。
  • 本文探索动机:
    • 保留窄带 attention 的空间向量聚类能力。
    • 重新设计归一化,让网络稳定训练,同时尊重频率维度的物理含义。

■ 网络具体结构:

  • 仍以窄带 Conformer 为主体,由 self-attention、卷积前馈网络和归一化模块组成。
  • 新增 Group Batch Normalization,简称 GBN。
  • GBN 把“组”的概念和窄带频率绑定起来,避免把不同频率的隐藏单元分布粗暴混合。
  • 论文还通过 attention map 说明网络确实在做帧级空间向量聚类。

NBC2 结构

整体框架结构和NBC相同

NBC2 中的频率绑定理解

■ 模型输入:

  • 输入是固定频率下多麦克风混合语音的 STFT 复数系数。
  • 每个频率独立处理,所有频率共享网络。

■ 模型输出:

  • 输出物理意义: 个目标说话人在参考通道上的纯净语音空间图像复数 STFT。
  • 激活函数:按复数谱连续值直接回归,可理解为 Identity。
  • 固定频率下的维度:

■ 实验设置:

  • 数据集:
    • 圆形阵列 Spatialized WSJ0-2mix:20,000 句训练、5,000 句验证、3,000 句测试;8 通道圆形阵列,半径约 5 cm,RT60 覆盖
    • 随机阵列数据:8 通道随机阵列几何,RT60 约
  • 评价指标:
    • NB-PESQ,越高越好。
    • WB-PESQ,越高越好。
    • SDR,越高越好。

■ 展望与总结:

  • NBC2 的重点不是换一个更大的网络,而是让窄带网络内部的统计处理更符合频率结构。
  • 它为 SpatialNet 铺路:如果要继续提升,必须让窄带时间建模和跨频率信息融合一起工作。
  • 后续自然方向是连续长语音、在线处理和更完整的联合增强任务。

2024 | SpatialNet:窄带时间建模加跨带频率建模

■ 基本信息:

  • 论文英文原名:SpatialNet: Extensively Learning Spatial Information for Multichannel Joint Speech Separation, Denoising and Dereverberation
  • 中文翻译:(SpatialNet:充分学习空间信息的多通道联合语音分离、降噪和去混响)
  • 发表年份:2024
  • 作者信息:Changsheng Quan, Xiaofei Li
  • 所属单位:Zhejiang University;Westlake University & Westlake Institute for Advanced Study;Westlake University School of Engineering

■ 核心任务:

  • 解决多通道端到端联合语音分离、降噪和去混响问题;输入是多麦克风混合录音,输出是参考麦克风位置上的干净目标语音。

■ 研究动机:

  • 传统方法/前人工作不足:
    • 早期窄带模型擅长利用空间信息,但频率之间交流不足。
    • 只做分离、只做降噪或只做去混响都不足以覆盖真实会议录音。
    • 纯全频带模型容易依赖频谱模式,跨数据集泛化可能不稳定。
  • 本文探索动机:
    • 用 narrow-band block 继续处理固定频率下的时间和空间线索。
    • 用 cross-band block 补上跨频率的谱结构和身份一致性。
    • 在一个网络里同时覆盖分离、降噪、去混响。

■ 网络具体结构:

  • 输入先通过特征转换层,把 个实部/虚部通道投影到隐藏维度
  • 主体由交替堆叠的 narrow-band block 和 cross-band block 构成。
  • Narrow-band block 固定频率,沿时间处理,内部包含 self-attention 和 temporal convolution,用来做空间特征聚类、时间平滑和混响拖尾建模。
  • Cross-band block 固定时间帧,沿频率处理,使用 full-band linear layer 和 frequency convolution,分别学习全频率相关性和相邻频率局部结构。
  • 末端将隐藏特征映射回目标语音的复数 STFT,再通过 iSTFT 回到波形。

SpatialNet 总体结构

■ 模型输入:

  • 输入是 STFT 域下多通道麦克风混合信号的实部和虚部拼接。
  • 完整输入维度:
  • 是麦克风数, 是时间帧数, 是频率格点数。

■ 模型输出:

  • 输出物理意义:参考麦克风上 个目标说话人的纯净语音复数 STFT。
  • 激活函数:按复数谱连续值直接回归,可理解为 Identity;它不是 MRM 这类 mask。
  • 输出维度:
  • 对应实部和虚部。输出经 iSTFT 恢复为 路时域波形。

■ 实验设置:

  • 数据集:
    • 人工合成数据:SMS-WSJ、WHAMR!、Spatialized WSJ0-2mix。
    • 真实录音数据:LibriCSS、REVERB Challenge、CHiME 3/4 Challenge。
  • 评价指标:
    • SDR、SI-SDR、SA-SDR,越高越好。
    • NB-PESQ、WB-PESQ,越高越好。
    • STOI、eSTOI,越高越好。
    • FWSSNR、SRMR,越高越好。
    • CD、LLR,越低越好。
    • WER,越低越好。

■ 展望与总结:

  • SpatialNet 把前面的两类建模放进同一网络:窄带块负责空间和时间,跨带块负责频率关联。
  • 它把早期“按频率做增强/分离”的思路推进到联合增强系统,任务覆盖更接近真实录音。
  • 离线 SpatialNet 可以读取完整音频,实时会议、助听器和机器人听觉则只能使用当前和过去的信息,因此还需要在线版本。

SpatialNet-small 复现补充:WHAMR 与 SMS-WSJ-Plus

本地复现使用 WHAMR 测试集和 SpatialNet-small。训练到 100 轮,保存的最佳权重来自第 99 轮。复现时要区分两类差距:未处理输入的差距,以及模型输出的差距。前者接近说明数据和评测大体对齐;后者偏低更可能来自训练细节、GPU 环境、权重选择或模型平均策略。

SMS-WSJ-Plus 上的论文值和复现值:

Model NB-PESQ P/R eSTOI P/R SI-SDR P/R
Unprocessed 1.35 / 1.357 0.261 / 0.263 -11.4 / -11.341
SpatialNet-small 3.11 / 2.984 0.878 / 0.852 13.8 / 12.444

WHAMR 上的论文值和复现值:

Model SI-SDR P/R SDR P/R NB-PESQ P/R eSTOI P/R
Unprocessed -6.1 / -6.127 -3.5 / -3.487 1.41 / 1.415 0.317 / 0.317
SpatialNet-small 11.8 / 11.136 13.1 / 12.435 2.93 / 2.808 0.826 / 0.805

表示论文报告值, 表示本地复现值。未处理输入差距很小,模型输出有一定差距。一个合理解释是论文提到最后若干轮权重平均,而本地复现使用官方仓库保存的单轮最优权重。

2024 | Online SpatialNet:把 SpatialNet 推向长时流式增强

■ 基本信息:

  • 论文英文原名:Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
  • 中文翻译:(针对静态和移动说话人的多通道长时流式神经语音增强)
  • 发表年份:2024
  • 作者信息:Changsheng Quan, Xiaofei Li
  • 所属单位:Zhejiang University;Westlake University & Westlake Institute for Advanced Study;Westlake University

■ 核心任务:

  • 解决多通道长时流式语音降噪和去混响问题;目标是在线处理静态和移动说话人,不再要求一次看到完整音频。

■ 研究动机:

  • 传统方法/前人工作不足:
    • 离线 SpatialNet 使用完整上下文,实时系统不能偷看未来帧。
    • 标准 self-attention 对长音频计算代价高,几分钟会议音频会带来显存和延迟问题。
    • 训练短音频得到的模型,直接测试很长音频时可能外推能力不足。
  • 本文探索动机:
    • 用线性或近线性的在线序列模块替代离线 self-attention。
    • 让模型只依赖当前和过去信息,同时保留长程历史建模能力。
    • 用短语音训练加长语音微调提高长度外推能力。

■ 网络具体结构:

  • 以 SpatialNet 为基础,重点改 narrow-band block 的时间建模部分。
  • 时间卷积改为因果卷积,保证不看未来帧。
  • 提出三种在线变体:
    • oSpatialNet-MSA:masked self-attention,只在过去固定窗口内计算注意力。
    • oSpatialNet-Ret:Retention,用状态矩阵和指数衰减压缩历史,实现线性推理。
    • oSpatialNet-Mamba:用 Mamba 结构化状态空间模型替换原有自注意力和时间卷积前馈模块。
  • 训练策略是 ST+LF:先用短语音训练,再用长语音微调。

Online SpatialNet 与 Mamba 变体

■ 模型输入:

  • 输入是多通道长时流式 STFT 复数特征。
  • 每次推理只能使用当前帧和历史帧,不能使用未来帧。

■ 模型输出:

  • 输出物理意义:增强后的目标语音复数 STFT,主要用于降噪和去混响。
  • 激活函数:按复数谱连续值直接回归,可理解为 Identity。
  • 维度:沿用 SpatialNet 型输出,通常可写成 ;在单目标增强设置下
  • 输出经 iSTFT 还原为时域增强语音。

■ 实验设置:

  • 数据集:模拟的静态和移动说话人数据;房间 RT60 覆盖 ,6 通道阵列拓扑接近 CHiME-3,噪声来自 CHiME-3,SNR 在 之间采样。
  • 评价指标:
    • NB-PESQ,越高越好。
    • ESTOI,越高越好。
    • SI-SDR,越高越好。
    • SDR,越高越好。
    • 参数量、FLOPs、是否因果,用于评估复杂度和实时性,通常越低越利于部署。

■ 展望与总结:

  • Online SpatialNet 回答的是“SpatialNet 怎样进入实时场景”。
  • Mamba 和 Retention 的引入说明,这条路线后续很可能继续吸收长序列建模的新模块。
  • 真正落地时还要继续看延迟、显存、说话人移动速度和长音频外推能力。

路线总结

按时间线看,这条路线可以压缩成下面几步:

1
2
3
4
5
6
7
2019 子带 LSTM
-> 2020 窄带深度滤波
-> 2022 NBSS
-> 2022 NBC / NBC2
-> 2024 SpatialNet
-> 2024 Online SpatialNet
-> 轻量化、动态声源和频谱-空间解耦

每一步解决的问题不同:

时间 核心推进 可以这样记
2019 把深度网络放进窄带多通道降噪 固定频率,沿时间学空间线索
2020 输出从 MRM 扩展到 CC 和 SF/SSF 不只预测保留比例,也预测复数谱和空间滤波器
2022 NBSS 把窄带推进到多人分离 用 fPIT 解决频率错排
2022 NBC 引入 Conformer 用 attention 做空间向量聚类
2022 NBC2 修正归一化和频率结构 GBN 保护窄带统计
2024 SpatialNet 窄带块和跨带块交替 同时处理空间、时间、频率
2024 Online SpatialNet 因果流式和长音频 用 MSA/Retention/Mamba 替换离线 attention

这条路线的学习重点不是背模型名,而是理解四个维度的分工:

维度关系 直观理解 建模意义
空间-通道 通道是空间的离散采样点 麦克风阵列把三维空间转成多路观测,TDOA 和 ILD 是重要线索
空间-频率 相同延迟在不同频率上表现为不同相位差 高频容易相位缠绕,需要跨频率验证线索是否一致
空间-时间 房间反射把一次传播拉长成时间序列 去混响和动态声源都需要长程时间建模
时间-频率 STFT 窗长决定时频分辨率 长窗频率细,短窗时间准,需要按任务权衡
通道-时间 单帧通道观测不稳定,需要跨帧统计 空间协方差、空间向量聚类都依赖多帧信息
通道-频率 声学传播路径随频率变化 RTF 和复数空间滤波通常要逐频率估计

后续展望

展望论文总结了该领域迈向实际落地所面临的核心挑战与未来发展方向:

  • 长音频处理:缓解注意力机制在处理几分钟级别长会议语音时的算力和内存瓶颈。
  • 轻量化模型:在保证分离性能的前提下压缩庞大的参数量,以适配移动手机和边缘受限设备。
  • 因果流式分离 (Causal Separation):强制网络仅依赖当前和历史特征(不看未来帧),以实现助听器等设备的极低延迟实时处理。
  • 生成式方法引入:利用扩散模型 (Diffusion) 和 GAN 来提升模型在极端噪声下的泛化性,改善判别式模型易产生的语音伪影和失真。
  • 联合建模:将语音分离与下游的 ASR(语音识别)、Speaker Diarization(说话人日记)等任务进行端到端一体化联合训练,彻底解决“谁在什么时候说了什么”的问题。

扩展阅读