中文

语音感知大语言模型中语言理解能力的保持

计算与语言 2025-10-17 v2 人工智能

摘要

本文提出了 C3T(跨模态能力保持测试,Cross-modal Capabilities Conservation Test),一种用于评估语音感知大语言模型性能的新基准。该基准利用文本任务和语音克隆文本转语音模型,量化了当通过语音输入访问模型时,其语言理解能力被保持的程度。C3T 量化了模型对不同类别说话人的公平性,及其在文本和语音模态间的鲁棒性。

关键词

引用

@article{arxiv.2509.12171,
  title  = {Preservation of Language Understanding Capabilities in Speech-aware Large Language Models},
  author = {Marek Kubis and Paweł Skórzewski and Iwona Christop and Mateusz Czyżnikiewicz and Jakub Kubiak and Łukasz Bondaruk and Marcin Lewandowski},
  journal= {arXiv preprint arXiv:2509.12171},
  year   = {2025}
}

备注

5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T