语音感知大语言模型中语言理解能力的保持
计算与语言
2025-10-17 v2 人工智能
摘要
本文提出了 C3T(跨模态能力保持测试,Cross-modal Capabilities Conservation Test),一种用于评估语音感知大语言模型性能的新基准。该基准利用文本任务和语音克隆文本转语音模型,量化了当通过语音输入访问模型时,其语言理解能力被保持的程度。C3T 量化了模型对不同类别说话人的公平性,及其在文本和语音模态间的鲁棒性。
引用
@article{arxiv.2509.12171,
title = {Preservation of Language Understanding Capabilities in Speech-aware Large Language Models},
author = {Marek Kubis and Paweł Skórzewski and Iwona Christop and Mateusz Czyżnikiewicz and Jakub Kubiak and Łukasz Bondaruk and Marcin Lewandowski},
journal= {arXiv preprint arXiv:2509.12171},
year = {2025}
}
备注
5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T