中文

面向低资源达利安语语言的 GPT 单词级代码混合语言识别提示工程

计算与语言 2025-03-13 v2

摘要

语言识别 (LI) 对各种自然语言处理任务至关重要,作为诸如情感分析、机器翻译和信息检索等应用的基础步骤。在印度等多语言社会中,尤其是青年在社交媒体上交流时,文本常常在不同语言层面上混合本地语言与英语,这种现象为 LI 系统带来了巨大挑战,尤其当语言在单个单词内部交织时。达利安语语言在印度南部盛行,拥有丰富的形态结构,却在数字平台上代表不足,导致采用罗马语或混合脚本进行交流。本文介绍一种用于解决达利安语单词级 LI 挑战的共享任务的方法。我们利用 GPT-3.5 Turbo 来了解大型语言模型是否能够正确地将单词分类到正确类别。我们的发现表明,Kannada 模型在大多数指标上始终优于 Tamil 模型,表明其在识别和分类 Kannada 语言实例方面具有更高的准确率和可靠性。相比之下,Tamil 模型表现温和,尤其在精确率和召回率方面需要改进。

关键词

引用

@article{arxiv.2411.04025,
  title  = {Prompt Engineering Using GPT for Word-Level Code-Mixed Language Identification in Low-Resource Dravidian Languages},
  author = {Aniket Deroy and Subhankar Maity},
  journal= {arXiv preprint arXiv:2411.04025},
  year   = {2025}
}

备注

Updated and Final Version