Turk-LettuceDetect:面向土耳其RAG应用的误检测模型
计算与语言
2025-09-23 v1 人工智能
摘要
大型语言模型(LLM)的广泛采用受到其倾向于生成符合逻辑但事实错误信息的限制。虽然检索增强生成(RAG)系统试图通过以外部知识为基础来解决此问题,但误检测仍是一个持久的挑战,尤其是针对形态复杂、资源有限的语言如土耳其语。本文介绍Turk-LettuceDetect,首个专为土耳其RAG应用设计的误检测模型套件。基于LettuceDetect框架,我们将误检测建模为标记级分类任务,对三个不同的编码器架构进行微调:土耳其专用ModernBERT、TurkEmbed4STS和多语言EuroBERT。这些模型在包含17,790个实例的人工翻译RAGTruth基准数据集上训练完成,涵盖问答、数据到文本生成和摘要生成等任务。我们的实验结果显示,基于ModernBERT的模型在完整测试集上 achieves 0.7266的 F1-score,结构化任务方面表现尤为出色。模型在保持计算效率的同时支持最长8,192个标记的长上下文,适用于实际部署。比较分析表明,虽然最新LLM在召回率方面表现高,但由于过度生成误检测内容,精确率较低,这凸显了专门检测机制的必要性。通过发布我们的模型和翻译后数据集,该工作填补了多语言NLP中的关键空白,为土耳其语及其他语言开发更可靠可信赖的AI应用奠定了基础。
关键词
引用
@article{arxiv.2509.17671,
title = {Turk-LettuceDetect: A Hallucination Detection Models for Turkish RAG Applications},
author = {Selva Taş and Mahmut El Huseyni and Özay Ezerceli and Reyhan Bayraktar and Fatma Betül Terzioğlu},
journal= {arXiv preprint arXiv:2509.17671},
year = {2025}
}