利用扩散模型破译甲骨文
计算机视觉与模式识别
2025-03-25 v3 计算与语言
摘要
甲骨文起源于约3000年前的中国商朝,是语言史上的基石,早于许多已建立的文字系统。尽管已发现数千片甲骨刻辞,但仍有大量甲骨文未被破译,为这种古老语言蒙上了神秘的面纱。现代人工智能技术的出现为甲骨文破译开辟了新的前沿,挑战了传统自然语言处理方法严重依赖大型文本语料库的局限——而历史语言并不具备这种条件。本文引入了一种新颖的方法,采用图像生成技术,具体通过开发甲骨文破译系统(OBSD)。利用基于条件扩散的策略,OBSD为破译生成关键线索,为人工智能辅助分析古代语言开辟了新路径。为了验证其有效性,在甲骨文数据集上进行了大量实验,定量结果证明了OBSD的有效性。代码和破译结果将在 https://github.com/guanhaisu/OBSD 上提供。
引用
@article{arxiv.2406.00684,
title = {Deciphering Oracle Bone Language with Diffusion Models},
author = {Haisu Guan and Huanxin Yang and Xinyu Wang and Shengwei Han and Yongge Liu and Lianwen Jin and Xiang Bai and Yuliang Liu},
journal= {arXiv preprint arXiv:2406.00684},
year = {2025}
}
备注
ACL 2024 Best Paper