中文

通过表意驱动微调提升多模态大语言模型在古代汉字演化分析中的表现

计算与语言 2026-04-14 v1 人工智能

摘要

近年来,多模态大语言模型 (MLLM) 的快速进步日益推动了古代汉字研究的深入。由于文字演化构成理解文化变迁和历史延续性的基本路径,如何系统性地利用 MLLM 支持并推动文本演化分析仍是一个在实际应用中鲜有探索的开放问题。为弥合这一差距,我们构建了一个包含 11 项任务和 13 万余实例的综合基准数据集,专为评估 MLLM 在古代汉字演化分析中的能力而设计。我们对多个广泛使用的 MLLM 进行了广泛评估,发现虽然现有模型在表意层面比较方面能力有限,但在核心任务(如字符识别和演化推理)上的表现仍受到显著限制。基于这些发现,我们提出了一种表意驱动微调框架 (GEVO),显式鼓励模型捕捉表意演化变换的一致性,增强其对文本演化的理解。实验结果表明,即便是 2B 参数规模的模型在所有评估任务中也实现了一致且全面的性能提升。为促进未来研究,我们公开了该基准数据集和训练好的模型\footnote{https://github.com/songruiecho/GEVO}。

关键词

引用

@article{arxiv.2604.11299,
  title  = {Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning},
  author = {Rui Song and Lida Shi and Ruihua Qi and Yingji Li and Hao Xu},
  journal= {arXiv preprint arXiv:2604.11299},
  year   = {2026}
}

备注

Accepted by ACL 2026 main