中文

Fuxí:评估古代中文文本理解与生成的基准

计算与语言 2025-03-21 v1 人工智能

摘要

古代中文文本处理为大型语言模型 (LLM) 带来了独特的挑战,due to its distinct linguistic features, complex structural constraints, and rich cultural context。虽然现有的基准主要侧重于通过多选题评估理解能力,但在评估模型在古典中文生成能力方面仍存在关键缺口。我们引入 Fuxí,一个涵盖 21 种多样化任务的综合性基准,用于评估理解和生成能力。我们的基准通过三个关键贡献实现:(1)覆盖理解和生成任务的平衡,包括诗歌创作和对联续写等新任务;(2)专为古典中文文本生成设计的专业评估指标,结合基于规则的验证与微调 LLM 评估器;(3)考虑语言准确性和文化真实性的系统性评估框架。通过对最新 LLM 的广泛评估,我们揭示了理解与生成任务之间存在显著的性能差距,模型在理解任务上取得有希望的结果,但在需要深厚文化知识和遵循古典格式的生成任务上表现严格不足。我们的发现凸显了古代中文文本处理中的当前局限,为未来模型开发提供了见解。该基准、评估工具包和基线结果已公开,以促进该领域的研究。

关键词

引用

@article{arxiv.2503.15837,
  title  = {F\`ux\`i: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation},
  author = {Shangqing Zhao and Yuhao Zhou and Yupei Ren and Zhe Chen and Chenghao Jia and Fang Zhe and Zhaogaung Long and Shu Liu and Man Lan},
  journal= {arXiv preprint arXiv:2503.15837},
  year   = {2025}
}

备注

working in progress