中文

XNote:面向图像基上下文误导的自动化社区注释生成基准

计算与语言 2026-05-20 v2 社会与信息网络

摘要

社区注释已成为有效应对社交媒体平台上网络欺骗的众包机制,但其依赖人类贡献者限制了时效性和可扩展性。本文研究针对图像基上下文误导的自动化社区注释生成任务,即将真实图像配以误导性上下文(如时间、实体和事件)。不同于以往主要关注欺骗检测(即二元判断帖子真假)的工作,自动化社区注释生成要求生成简洁且有依据的注释,帮助用户恢复缺失或更正后的上下文。由于缺乏支持此任务的数据集,此问题尚未得到充分探索。为此,我们构建了一个真实世界的数据集 XNote,包含带社区注释和外部上下文的 X 篇帖子,以及主题和误导因素的标注。我们进一步对多种前沿大型视觉语言模型(LVLMs)在 XNote 上的性能进行基准测试,评估其在欺骗检测和注释生成任务中的表现。我们还与一种端到端方法 SNIFFER 以及商业工具 GPT-5 进行比较。我们的结果揭示了自动化社区注释生成的挑战,凸显了为此任务构建更佳方法和指标的必要性。

关键词

引用

@article{arxiv.2603.22453,
  title  = {XNote: Benchmarking Automated Community Notes Generation for Image-based Contextual Deception},
  author = {Jin Ma and Jingwen Yan and Mohammed Aldeen and Ethan Anderson and Taran Kavuru and Jinkyung Katie Park and Feng Luo and Long Cheng},
  journal= {arXiv preprint arXiv:2603.22453},
  year   = {2026}
}