识别对话音频中的听力困难时刻
声音
2025-08-01 v1 音频与语音处理
摘要
个体在日常对话中经常经历听力困难时刻。识别这些听力困难的时刻在听力辅助技术领域具有特别重要意义,因为及时的干预对于实时听力帮助至关重要。本文提出并比较了用于持续检测对话音频中识别这些特定时刻的说话内容的机器学习解决方案。我们表明,音频语言模型凭借其多模态推理能力在这一任务中表现出色,显著优于简单的ASR热词启发式方法和更常规的基于Wav2Vec的微调方法,后者是一种用于自动语音识别(ASR)的状态-of-the-art音频-only输入架构。
引用
@article{arxiv.2507.23590,
title = {Identifying Hearing Difficulty Moments in Conversational Audio},
author = {Jack Collins and Adrian Buzea and Chris Collier and Alejandro Ballesta Rosen and Julian Maclaren and Richard F. Lyon and Simon Carlile},
journal= {arXiv preprint arXiv:2507.23590},
year = {2025}
}