ProtoSound:面向聋人和重听用户的个性化可扩展声音识别系统
人机交互
2022-02-24 v1 机器学习
声音
音频与语音处理
摘要
最近的进展已使移动设备上面向聋人和重听(DHH)用户的自动声音识别系统成为可能。然而,这些工具使用预训练的通用声音识别模型,无法满足DHH用户多样化的需求。我们引入ProtoSound,一个通过录制少量示例来自定义声音识别模型的交互式系统,从而实现个性化和细粒度的类别。ProtoSound的动机源于先前考察DHH人群声音感知需求的工作以及我们对472名DHH参与者进行的调查。为评估ProtoSound,我们在两个真实世界声音数据集上刻画了性能,显示出相对于最先进技术的显著改进(例如,在第一个数据集上准确率提升9.7%)。然后我们通过移动应用部署了ProtoSound的终端用户训练和实时识别,并招募了19名听力正常参与者,他们聆听真实世界声音并对56个地点(例如家庭、餐厅、公园)的准确率进行评分。结果显示ProtoSound在设备上实时个性化模型,并准确学习了跨不同声学环境的声音。我们以讨论个性化声音识别中的开放挑战作结,包括需要更好的录制界面和算法改进。
引用
@article{arxiv.2202.11134,
title = {ProtoSound: A Personalized and Scalable Sound Recognition System for Deaf and Hard-of-Hearing Users},
author = {Dhruv Jain and Khoa Huynh Anh Nguyen and Steven Goodman and Rachel Grossman-Kahn and Hung Ngo and Aditya Kusupati and Ruofei Du and Alex Olwal and Leah Findlater and Jon E. Froehlich},
journal= {arXiv preprint arXiv:2202.11134},
year = {2022}
}
备注
Published at the ACM CHI Conference on Human Factors in Computing Systems (CHI) 2022