儿童-成人互动中的环视说话人分类:从感知到计算建模
声音
2025-06-03 v2 人工智能
音频与语音处理
摘要
自闭谱系障碍(ASD)是一种神经发育疾病,表现为社交沟通、重复行为和感觉处理方面的挑战。ASD 研究的一个重要领域是评估儿童在治疗期间的行为变化。以往的标准化程序是 BOSCC,该程序涉及儿童与临床医生之间的二人互动,包含一组预定义的活动。理解儿童在这些互动中行为的关键方面是自动语音理解,特别是识别谁说话以及何时说话。传统方法在这一领域主要依赖来自观众视角记录的语音样本,关于环视语音建模的研究有限。本研究设计了一种实验,旨在使用可穿戴传感器从环视视角对 BOSCC 访谈进行语音采样,并探索使用 Ego4D 语音样本进行预训练,以提高儿童-成人说话人分类在二人互动中的准确性。我们的发现突显了环视语音收集和预训练在提高说话人分类准确性方面的潜力。
引用
@article{arxiv.2409.09340,
title = {Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling},
author = {Tiantian Feng and Anfeng Xu and Xuan Shi and Somer Bishop and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2409.09340},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025