解析开关:基于大型语言模型的复杂代码切换和低资源语言通用依赖标注
计算与语言
2025-06-10 v1 人工智能
摘要
代码切换为句法分析提出了复杂挑战,尤其是在标注数据稀缺的低资源语言环境中。虽然近期工作探索了大型语言模型 (LLM) 用于序列级标记的方法,但鲜有研究系统性地检验这些模型在代码切换语境下是否能够捕捉句法结构。此外,现有基于单语语料库训练的解析器往往难以泛化到多语言和混合语言输入。为此,我们引入 BiLingua Parser,一个基于大型语言模型的注释管道,旨在为代码切换文本生成通用依赖 (UD) 注释。首先,我们开发了一个针对西班牙-英语和西班牙-瓜拉尼数据的数据驱动框架,结合少样本 LLM 提示和专家审阅。其次,我们发布了两个标注数据集,包括首个西班牙-瓜拉尼 UD 解析语料库。随后,我们对语言对和沟通语境中的切换点进行了详细的句法分析。实验结果表明,BiLingua Parser 在专家审阅后达到了最高 95.29% 的最小句法得分 (LAS),显著优于先前的基线和多语言解析器。这些结果表明,在谨慎引导下,大型语言模型可作为在资源稀缺、代码切换环境中引导句法资源的实用工具。数据和源代码均可在 https://github.com/N3mika/ParsingProject 获取。
引用
@article{arxiv.2506.07274,
title = {Parsing the Switch: LLM-Based UD Annotation for Complex Code-Switched and Low-Resource Languages},
author = {Olga Kellert and Nemika Tyagi and Muhammad Imran and Nelvin Licona-Guevara and Carlos Gómez-Rodríguez},
journal= {arXiv preprint arXiv:2506.07274},
year = {2025}
}
备注
16 pages