中文

中文字符视觉信息的影响:评估大模型识别和利用偏体的能力

计算与语言 2025-01-31 v3

摘要

汉字的字形书写体系包含每一字符中丰富的视觉特征,如偏体(radicals)可提供关于含义或读音的线索。然而,目前尚无研究探讨当代大语言模型(LLM)和视觉语言模型(VLM)是否可以通过提示词(prompting)利用这些汉字亚字符特征。本研究构建了一个基准测试,用于评估LLM和VLM对汉字视觉元素(包括偏体、构成结构、笔画及笔画数)的理解能力。我们的结果表明,无论是否提供字符图像,模型都呈现出一定程度的视觉信息知识,但仍有限。为激发模型运用偏体的能力,我们进一步实验性地将偏体纳入中文语言处理(CLP)任务的提示词中。我们观察到在提供偏体信息的情况下,命名实体识别(POS tagging)性能得到一致性提升,这表明整合亚字符信息有望增强CLP任务的效果。

关键词

引用

@article{arxiv.2410.09013,
  title  = {The Impact of Visual Information in Chinese Characters: Evaluating Large Models' Ability to Recognize and Utilize Radicals},
  author = {Xiaofeng Wu and Karl Stratos and Wei Xu},
  journal= {arXiv preprint arXiv:2410.09013},
  year   = {2025}
}

备注

Accepted to NAACL 2025