DongbaMIE:用于评估东巴象形文字语义理解的多模态信息提取数据集
计算机视觉与模式识别
2025-05-23 v4
摘要
东巴象形文字是世界上唯一仍在使用的象形文字系统。其图像表意特征承载着丰富的文化和语境信息。然而,由于缺乏相关数据集,东巴象形文字的语义理解研究进展缓慢。为此,我们构建了DongbaMIE——第一个专注于东巴象形文字多模态信息提取的数据集。该数据集包含东巴象形文字字符的图像及其对应的中文语义标注。它包含23,530个句子级和2,539个段落级的高质量文本-图像对。标注涵盖四个语义维度:对象、动作、关系和属性。对主流多模态大语言模型的系统评估表明,模型在零样本和少样本学习条件下难以高效地进行东巴象形文字的信息提取。虽然监督微调可以提升性能,但复杂语义的准确提取目前仍是一个巨大挑战。
引用
@article{arxiv.2503.03644,
title = {DongbaMIE: A Multimodal Information Extraction Dataset for Evaluating Semantic Understanding of Dongba Pictograms},
author = {Xiaojun Bi and Shuo Li and Junyao Xing and Ziyue Wang and Fuwen Luo and Weizheng Qiao and Lu Han and Ziwei Sun and Peng Li and Yang Liu},
journal= {arXiv preprint arXiv:2503.03644},
year = {2025}
}
备注
Our dataset can be obtained from: https://github.com/thinklis/DongbaMIE