RetrieveGPT:融合提示词与数学模型以增强代码混合信息检索
计算与语言
2025-03-27 v3
摘要
代码混合是指在单一句子中整合多种语言的词汇和语法元素,是一种普遍的语言现象,在多语言社会中尤为普遍。在印度,社交媒体用户经常使用罗马字母进行代码混合对话,特别是在移民社区中,他们组建在线群组来分享相关的地方信息。本文聚焦于从代码混合对话中提取相关信息所面临的挑战,具体针对罗马化转写的孟加拉语与英语的混合。本研究通过开发一种自动识别代码混合对话中最相关答案的机制,提出了一种新颖的方法来解决这些挑战。我们在一个包含来自Facebook的查询和文档以及查询相关性文件(QRels)的数据集上进行了实验。我们的结果表明,该方法在从复杂的代码混合数字对话中提取相关信息方面的有效性,为多语言和非正式文本环境中的自然语言处理领域做出了更广泛的贡献。我们使用GPT-3.5 Turbo通过提示词,并结合相关文档的序列特性来构建一个数学模型,该模型有助于检测与查询相对应的相关文档。
引用
@article{arxiv.2411.04752,
title = {RetrieveGPT: Merging Prompts and Mathematical Models for Enhanced Code-Mixed Information Retrieval},
author = {Aniket Deroy and Subhankar Maity},
journal= {arXiv preprint arXiv:2411.04752},
year = {2025}
}
备注
Final and Updated version