ParaLBench:面向声学基础模型的计算副语言学大规模基准测试
声音
2024-11-15 v1 音频与语音处理
摘要
计算副语言学(ComParal)旨在开发算法和模型,以自动检测、分析和解释语音交流中的非语言信息,例如情感、健康状况、年龄和性别。尽管取得了快速进展,但它严重依赖于针对特定副语言学任务精心设计的模型。因此,ComParal 模型的异构性和多样性在很大程度上阻碍了 ComParal 模型的实际应用。近年来,随着自监督学习带来的声学基础模型的出现,开发能够高效感知大量副语言信息的更通用模型已成为语音处理中的活跃课题。然而,目前缺乏一个统一的评估框架来进行公平且一致的性能比较。为了弥合这一差距,我们开展了一项名为 ParaLBench 的大规模基准测试,专注于标准化各种副语言学任务的评估过程,包括情感计算的关键方面(如情感识别和情感维度预测),并在不同的声学基础模型上进行。该基准测试包含十个数据集和十三个不同的副语言学任务,涵盖短期、中期和长期特征。每个任务在统一评估框架下的 14 个声学基础模型上执行,这允许进行无偏见的方法学比较,并为 ComParal 社区提供有根据的参考。基于从 ParaLBench 获得的见解,我们还指出了潜在的研究方向,即跨语料库泛化能力,以推动未来的 ComParal 研究。与本研究的代码将公开提供,以促进后续研究人员对本工作的透明度和可重复性。
引用
@article{arxiv.2411.09349,
title = {ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models},
author = {Zixing Zhang and Weixiang Xu and Zhongren Dong and Kanglin Wang and Yimeng Wu and Jing Peng and Runming Wang and Dong-Yan Huang},
journal= {arXiv preprint arXiv:2411.09349},
year = {2024}
}