条件化 LLM 以生成代码切换文本
计算与语言
2026-03-09 v3 人工智能
摘要
代码切换(Code-switching, CS)仍是自然语言处理(NLP)中的关键挑战,原因在于缺乏大规模、多样化的 CS 数据集用于稳健的训练和评估。尽管近期进展,但 LLM 在处理 CS 方面的能力与局限性尚未完全理解。本文研究了 LLM 在 CS 文本生成框架中的应用,聚焦于英语-西班牙语语言对。我们提出的方法包括:将自然 CS 句子翻译成单语英语,并使用 resulting parallel corpus 对 LLM 进行微调,以将单语句子转换为 CS。我们通过人类偏好研究、定性错误分析、流行参考基准指标评估以及 LLM 基于评判等手段全面分析了模型性能。结果表明,微调是确保当前 LLM 持续生成流畅代码切换文本的关键步骤,而且我们的方法生成的输出质量较高,拓展了 CS 通信的研究机会。我们发现,传统指标在评估生成 CS 数据的质量时与人类判断不相关,但 LLM 基于评判更 closely 地与人类偏好相吻合。我们在 CC-BY-NC-SA 许可下发布了代码和生成数据集。
引用
@article{arxiv.2502.12924,
title = {Conditioning LLMs to Generate Code-Switched Text},
author = {Maite Heredia and Gorka Labaka and Jeremy Barnes and Aitor Soroa},
journal= {arXiv preprint arXiv:2502.12924},
year = {2026}
}
备注
[v2]Added new experiments and analyses [v3]Added out-of-domain evaluation; Accepted to LREC 2026