BLUFF:跨58种低资源语言虚假与合成内容检测基准
计算与语言
2026-03-03 v1
摘要
多语言虚假信息全球威胁着信息完整性,但检测基准仅限于英文或少数高资源语言,导致低资源语言社区缺乏稳健的防御工具。我们引入BLUFF,一个覆盖79种语言、超过20.2万样本的综合性虚假与合成内容检测基准,融合了人工撰写的事实核查内容(覆盖57种语言,12.2万+样本)与LLM生成内容(覆盖71种语言,7.9万+样本)。BLUFF独特地覆盖了高资源“大头”语言(20种)和低资源“尾部”语言(59种),填补了多语言虚假与合成内容检测研究中的关键空白。该数据集包含四种内容类型(人工撰写、LLM生成、LLM翻译、混合人工-LLM文本)、双向翻译(English↔X)、39种文本修改技术(36种虚假新闻操纵策略、3种AI编辑真实新闻策略)以及使用19种不同LLM生成的可变编辑强度。我们提出AXL-CoI(Adversarial Cross-Lingual Agentic Chain-of-Interactions),一种新型多智能体框架,用于受控的虚假/真实新闻生成,配合mPURIFY质量过滤管道确保数据集完整性。实验表明,领先的检测器在低资源语言上相对于高资源语言会出现最高25.3%的F1分数下降。BLUFF为研究社区提供了多语言基准、详尽的语言导向评估、全面文档以及开源工具,以推动公平的虚假内容检测。数据集和代码已公开于:https://jsl5710.github.io/BLUFF/。
引用
@article{arxiv.2603.00634,
title = {BLUFF: Benchmarking the Detection of False and Synthetic Content across 58 Low-Resource Languages},
author = {Jason Lucas and Matt Murtagh-White and Adaku Uchendu and Ali Al-Lawati and Michiharu Yamashita and Dominik Macko and Ivan Srba and Robert Moro and Dongwon Lee},
journal= {arXiv preprint arXiv:2603.00634},
year = {2026}
}