中文

MCGA:面向多任务的文言文体裁音频语料库

计算与语言 2026-04-14 v3

摘要

随着多模态大语言模型(MLLMs)的快速发展,其在中国古典研究(CCS)领域的潜力引起了广泛关注。现有研究主要聚焦于文本与视觉模态,而该领域内的音频语料库在很大程度上仍未被探索。为弥补这一空白,我们引入了面向多任务的文言文体裁音频语料库(MCGA),这是一个包含 22,000 个音频样本、总时长 119 小时的语料库。它涵盖了六种任务下多种多样的文学体裁:自动语音识别(ASR)、语音到文本翻译(S2TT)、语音情感描述(SEC)、口语问答(SQA)、语音理解(SU)和语音推理(SR)。通过对十个 MLLMs 的评估,我们的实验结果表明,当前的 MLLMs 在 MCGA 测试集上仍面临巨大挑战。此外,我们引入了一个针对 SEC 的特定领域评估指标,以及一个用于衡量语音与文本能力之间一致性的指标。我们向公众发布 MCGA,以促进更鲁棒的 MLLMs 的开发。MCGA 语料库:https://github.com/yxduir/MCGA

关键词

引用

@article{arxiv.2601.09270,
  title  = {MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus},
  author = {Yexing Du and Kaiyuan Liu and Bihe Zhang and Youcheng Pan and Bo Yang and Liangyu Huo and Xiyuan Zhang and Jian Xie and Daojing He and Yang Xiang and Ming Liu and Bing Qin},
  journal= {arXiv preprint arXiv:2601.09270},
  year   = {2026}
}

备注

Accepted in ACL 2026 (Findings)