中文

CoALFake: 结合人类-大语言模型协同标注的跨域虚假新闻检测协作主动学习

人工智能 2026-04-07 v1

摘要

虚假新闻在多领域中的广泛传播凸显了当前检测系统的关键局限性,这些系统通常表现出狭窄的领域特异性和较差的泛化能力。现有的跨域方法面临两个核心挑战:(1) 依赖标注数据,而此类数据往往难以获取且成本高昂;(2) 因僵化的领域划分或忽略领域特定特征而导致的信息损失。为解决这些问题,我们提出CoALFake,一种用于跨域虚假新闻检测的新方法,该方法将人类-大语言模型(LLM)协同标注与领域感知的主动学习(AL)相结合。我们的方法利用LLM进行大规模、低成本的标注,同时保持人类监督以确保标签可靠性。通过整合域嵌入技术,CoALFake能够动态捕捉领域特定的细微差别和跨域模式,从而实现领域无关模型的训练。此外,领域感知采样策略通过优先覆盖多样化的领域来优化样本获取。在多个数据集上的实验结果表明,所提出的方法持续优于各种基线方法。我们的结果表明,人类-LLM协同标注是一种极具成本效益的方法,能够提供优异的性能。多个数据集上的评估显示,即使仅依赖最少的人工监督,CoALFake也能持续超越一系列现有基线方法。

关键词

引用

@article{arxiv.2604.04174,
  title  = {CoALFake: Collaborative Active Learning with Human-LLM Co-Annotation for Cross-Domain Fake News Detection},
  author = {Esma Aïmeur and Gilles Brassard and Dorsaf Sallami},
  journal= {arXiv preprint arXiv:2604.04174},
  year   = {2026}
}