自驱动大语言模型模态扩展用于大型语音文本模型
计算与语言
2024-10-15 v2 声音
音频与语音处理
摘要
大型语言模型(LLM)在多样化任务上表现出卓越的性能,表明其在通过整合语音能力扩展至大型语音文本模型(LSM)方面的潜力。尽管统一的语音文本预训练和多模态数据指令调优方法提供了相当大的益处,但这些方法通常需要大量资源且倾向于过拟合特定任务。本研究旨在通过解决普通指令调优的局限性,改进语音数据集在LSM训练中的使用方式。我们探讨了LSM中的指令遵循动态,识别出一种关键问题——语音锚偏差:LSM倾向于过度依赖语音输入,误将整个语音模态解释为指令,从而忽略文本指令。为抵消此偏差,我们引入一种自驱动LSM,该模型利用自身生成的增强自动语音识别数据进行更有效的指令调优。我们的实验在多种语音任务上表明,自驱动LSM缓解了语音锚偏差,并改进了LSM中语音和文本模态的融合。数据、代码和脚本均可在 https://github.com/ytf-philp/Self-powered-LSM 免费获取。
引用
@article{arxiv.2410.03798,
title = {Self-Powered LLM Modality Expansion for Large Speech-Text Models},
author = {Tengfei Yu and Xuebo Liu and Zhiyi Hou and Liang Ding and Dacheng Tao and Min Zhang},
journal= {arXiv preprint arXiv:2410.03798},
year = {2024}
}
备注
Accepted to EMNLP 2024