UrduFactCheck:面向乌尔德语的智能体化事实核查框架
计算与语言
2025-10-30 v2
摘要
大型语言模型(LLM)的快速采用引发了对其输出事实可靠性的重要担忧,尤其是针对资源较少的语言,如乌尔德语。现有的自动事实核查系统主要为英文开发,为全球超过2亿乌尔德语使用者留下了显著空白。本文提出UrduFactBench和UrduFactQA,两个新构建的手工标注基准,旨在为乌尔德语的事实核查和事实一致性评估提供支持。尽管UrduFactBench聚焦于主张验证,但UrduFactQA则针对LLM在问答中的事实性。这些资源是首个为乌尔德语开发的基准,经过多阶段标注流程,由母语乌尔德语使用者完成。为配合这些基准,我们引入UrduFactCheck,一个模块化事实核查框架,集成单语种和翻译双重证据检索策略,以弥补高质量乌尔德语证据的稀缺。利用这些资源,我们对十二种LLM进行了广泛评估,结果表明翻译增强管道在性能上始终优于单语种管道。我们的发现揭示了开源LLM在乌尔德语中的持续挑战,强调开发针对性资源的重要性。所有代码和数据已公开于https://github.com/mbzuai-nlp/UrduFactCheck。
引用
@article{arxiv.2505.15063,
title = {UrduFactCheck: An Agentic Fact-Checking Framework for Urdu with Evidence Boosting and Benchmarking},
author = {Sarfraz Ahmad and Hasan Iqbal and Momina Ahsan and Numaan Naeem and Muhammad Ahsan Riaz Khan and Arham Riaz and Muhammad Arslan Manzoor and Yuxia Wang and Preslav Nakov},
journal= {arXiv preprint arXiv:2505.15063},
year = {2025}
}
备注
15 pages, 4 figures, 5 tables, 6 Listings, Published in Proceeding of The 2025 Conference on Empirical Methods in Natural Language Processing