中文

多模态语音-LLM 的情境鸣文数据创建:数据压缩与口语问答生成

计算与语言 2025-06-04 v2 人工智能 音频与语音处理

摘要

当前的语音-LLM 在情境推理和鸣文理解方面能力有限,主要由于缺乏覆盖两者的问答(QA)数据集。我们提出了一个新框架,用于从野外语音数据中生成数据集,将情境推理与鸣文信息相结合。该框架包括基于伪鸣文标签的数据压缩和基于 LLM 的情境鸣文问答(CPQA)生成。通过对 Qwen2-Audio-7B-Instruct 模型在我们框架创建的数据集和人类生成的 CPQA 数据集上的评估显示出强相关性。结果还表明,语音-LLM 在处理同情推理任务方面存在局限,这凸显了此类数据集和更健壮模型的必要性。该框架首次提出,具有在训练更具鸣文推理能力的语音-LLM方面潜力。

关键词

引用

@article{arxiv.2505.13338,
  title  = {Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation},
  author = {Qiongqiong Wang and Hardik B. Sailor and Tianchi Liu and Ai Ti Aw},
  journal= {arXiv preprint arXiv:2505.13338},
  year   = {2025}
}

备注

Accepted at Interspeech 2025. [v2]: The dataset has been released, and the link is now updated