具备准声学曲率和足够规则图的 GOAT-SLM:具备准声学和说话人特征感知的口语语言模型
计算与语言
2025-07-28 v2 人工智能
声音
音频与语音处理
摘要
最近的端到端口语语言模型 (SLM) 进展显著提升了 AI 系统进行自然口语交互的能力。然而,大多数现有模型仅将语音视作传递语言内容的载体,忽略了人类语音中嵌入的丰富的准声学和说话人特征线索,如方言、年龄、情感及非语音声音。在本工作中,我们引入了 GOAT-SLM,这是一个具备准声学和说话人特征感知的新型口语语言模型,旨在超越文本语义扩展口语语言建模。GOAT-SLM 采用双模态头架构,将语言建模与声学实现解耦,实现对语言理解的稳健性,同时支持具有表现力和自适应性的语音生成。为增强模型的效率和通用性,我们提出了一种模块化、分阶段的训练策略,逐步对齐语言、准声学和说话人特征信息,使用大规模语音-文本语料库。在TELEVAL上进行的实验结果表明,GOAT-SLM 在语义任务和非语义任务之间实现了良好均衡的性能,并在处理情感、方言变异及年龄敏感交互方面优于现有开源模型。本工作凸显了超越语言内容建模的重要性,推动了更自然、自适应且社会感知的口语语言系统的发展。
引用
@article{arxiv.2507.18119,
title = {GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness},
author = {Hongjie Chen and Zehan Li and Yaodong Song and Wenming Deng and Yitong Yao and Yuxin Zhang and Hang Lv and Xuechao Zhu and Jian Kang and Jie Lian and Jie Li and Chao Wang and Shuangyong Song and Yongxiang Li and Zhongjiang He and Xuelong Li},
journal= {arXiv preprint arXiv:2507.18119},
year = {2025}
}