中文

越过字母形: LLM 解译稀有脚本的评估

计算与语言 2025-01-30 v1 机器学习

摘要

我们探讨了 LVLMs 和 LLMs 在解译 Unicode 未编码的稀有脚本方面的能力. 我们引入一种新方法, 用于构建涉及此类脚本的语言拼图数据集, 利用语言字母形的 tokenization 方法. 我们的方法包括 LVLMs 用的图片方法和 LLMs 用的描述方法, 使这些模型能够应对这些挑战. 我们使用主要模型 GPT-4o、Gemini 和 Claude 3.5 Sonnet 对语言拼图进行实验. 我们的发现揭示了当前 AI 方法在语言解译方面的优势和局限性, 突显了 Unicode 编码对模型性能的影响以及通过描述建模视觉语言 token 的挑战. 本研究推进了理解 AI 在语言解译方面的潜力, 并强调了需要进一步研究的必要性.

关键词

引用

@article{arxiv.2501.17785,
  title  = {Reasoning Over the Glyphs: Evaluation of LLM's Decipherment of Rare Scripts},
  author = {Yu-Fei Shih and Zheng-Lin Lin and Shu-Kai Hsieh},
  journal= {arXiv preprint arXiv:2501.17785},
  year   = {2025}
}

备注

7 pages, 3 figures