中文

无需语言特定先验知识实现象形文字笔划级结构分析

计算机视觉与模式识别 2026-04-21 v2 计算与语言

摘要

象形文字作为一种表意文字系统,在其内部结构组成中编码了丰富的语义和文化信息。然而,当前先进的大语言模型(LLMs)和多模态大语言模型(MLLMs)通常对这些信息存在结构上的盲区。大语言模型将字符处理为文本标记,而多模态大语言模型则额外将其视为原始像素网格。两者都未能对字符笔划的底层逻辑进行建模。此外,现有的结构分析方法通常是针对特定文字且劳动密集型的。在本文中,我们提出了象形文字笔划分析器(HieroSA),这是一个新颖且可泛化的框架,使多模态大语言模型能够自动从字符位图中推导出笔划级结构,而无需手工制作的数据。它将现代表意文字和古代象形文字的字符图像转换为归一化坐标空间中显式、可解释的线段表示,从而实现跨语言泛化。大量实验表明,HieroSA有效地捕捉了字符内部结构和语义,绕过了对语言特定先验知识的需求。实验结果凸显了我们的工作作为字形学分析工具的潜力,有助于更深入地理解象形文字。查看我们的代码:https://github.com/THUNLP-MT/HieroSA。

关键词

引用

@article{arxiv.2601.05508,
  title  = {Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors},
  author = {Fuwen Luo and Zihao Wan and Ziyue Wang and Yaluo Liu and Pau Tong Lin Xu and Xuanjia Qiao and Xiaolong Wang and Peng Li and Yang Liu},
  journal= {arXiv preprint arXiv:2601.05508},
  year   = {2026}
}