AfrIFact:非洲语言的文化信息检索、证据提取与事实核查
计算与语言
2026-04-30 v2
摘要
评估在线提出的主张的真实性是一项复杂且重要的任务,具有现实意义。当这些主张针对信息获取有限的社区,且内容涉及医疗保健和文化等问题时,后果尤为严重,尤其是在低资源语言中。在本工作中,我们引入了 AfrIFact,一个涵盖自动事实核查必要步骤(即信息检索、证据提取和事实核查)的数据集,覆盖十种非洲语言和英语。我们的评估结果表明,即使最好的嵌入模型也缺乏跨语言检索能力,而且文化类与新闻类文档比医疗领域文档更容易检索,无论是在大型语料库还是单篇文档中。我们表明,大语言模型在非洲语言中缺乏鲁棒的多语言事实核查能力,而少样本提示可将 AfriqueQwen-14B 的性能提升最多 43%,任务特定微调可进一步将事实核查准确率提升最多 26%。这些发现,连同我们发布的 AfrIFact 数据集,鼓励了低资源信息检索、证据检索和事实核查方面的研究。
引用
@article{arxiv.2604.00706,
title = {AfrIFact: Cultural Information Retrieval, Evidence Extraction and Fact Checking for African Languages},
author = {Israel Abebe Azime and Jesujoba Oluwadara Alabi and Crystina Zhang and Iffat Maab and Atnafu Lambebo Tonja and Tadesse Destaw Belay and Folasade Peace Alabi and Salomey Osei and Saminu Mohammad Aliyu and Nkechinyere Faith Aguobi and Bontu Fufa Balcha and Blessing Kudzaishe Sibanda and Davis David and Mouhamadane Mboup and Daud Abolade and Neo Putini and Philipp Slusallek and David Ifeoluwa Adelani and Dietrich Klakow},
journal= {arXiv preprint arXiv:2604.00706},
year = {2026}
}