中文

跟踪听者注意力:基于注视引导的音视频语音增强框架

音频与语音处理 2026-04-10 v1

摘要

本文提出了一种基于注视引导的音视频语音增强(GG-AVSE)框架,以解决鸡尾酒派对问题。传统 AVSE 的主要挑战在于识别多说话人环境中听者的意图说话人。GG-AVSE 通过利用注视方向作为目标说话人选择的监督线索来解决此问题。具体而言,我们提出了 GG-VM 模块,将注视信号与 YOLO5Face 检测器结合以提取目标说话人的面部特征,并通过两种策略将其整合到预训练的 AVSEMamba 模型中:零样本合并和局部视觉微调。为进行评估,我们引入了 AVSEC2-Gaze 数据集。实验结果显示,GG-AVSE 在免注视基线之上实现了显著的性能提升:PESQ 提升 10.08%(从 2.370 提升至 2.609),STOI 提升 5.18%(从 0.8802 提升至 0.9258),SI-SDR 提升 23.69%(从 9.16 提升至 11.33)。这些结果确认了注视提供了有效的线索来解决目标说话人模糊问题,并突显了 GG-AVSE 在实际应用中的可扩展性。

关键词

引用

@article{arxiv.2604.08359,
  title  = {Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework},
  author = {Hsiang-Cheng Yang and You-Jin Li and Rong Chao and Yu Tsao and Borching Su and Shao-Yi Chien},
  journal= {arXiv preprint arXiv:2604.08359},
  year   = {2026}
}

备注

Accepted to IEEE ICASSP 2026