中文

CoHear:通过多耳机协作实现对话增强

声音 2025-12-04 v3

摘要

在会议等拥挤场所,背景噪声、重叠的语音和热烈的互动使得难以进行清晰的对话。这种情况通常会加剧被称为“鸡尾酒会耳聋”的现象。我们提出了 ClearSphere,这是一个通过多耳机在对话层面增强语音的协作系统。实时对话增强需要对对话中的所有成员进行整体建模,并需要一种从混合语音中提取语音的有效方法。ClearSphere 通过做出两项关键贡献,将声学传感器系统与用于目标语音提取的最先进深度学习连接起来:1) 对话驱动的网络协议,以及 2) 鲁棒的目标对话提取模型。我们的网络协议实现了耳机设备之间的移动式、无基础设施协调。我们的对话提取模型能够以带宽高效的方式利用中继音频。ClearSphere 在真实世界实验和仿真中均进行了评估。结果表明,我们的对话网络在群组形成方面获得了 90% 以上的准确率,与最先进的基准相比,语音质量提高了高达 8.8 dB,并在移动设备上展示了实时性能。在一项有 20 名参与者的用户研究中,ClearSphere 的得分远高于基准,且具有良好的可用性。

关键词

引用

@article{arxiv.2505.21004,
  title  = {CoHear: Conversation Enhancement via Multi-Earphone Collaboration},
  author = {Lixing He and Yunqi Guo and Zhenyu Yan and Guoliang Xing},
  journal= {arXiv preprint arXiv:2505.21004},
  year   = {2025}
}

备注

Submitted to IMWUT