SoK:用于错误信息检测的机器学习
机器学习
2025-01-28 v4 计算与语言
计算机与社会
摘要
我们以错误信息检测为案例,考察在将机器学习应用于信任与安全问题时学术研究与实践之间的脱节。我们调研了该领域248篇高被引论文中关于错误信息自动检测的文献。随后我们考察了其中部分论文的数据与代码可用性、设计失误、可复现性与泛化能力。我们的论文语料包含安全、自然语言处理与计算社会科学方向的已发表工作。在这些不同学科中,我们识别出数据集与方法设计中的常见错误。总体而言,检测任务往往与在线服务实际面临的挑战存在显著差异。数据集与模型评估常不能代表真实世界情境,且评估常无法独立于模型训练。我们通过三组代表性复现研究展示了当前检测方法的局限性。基于这些分析与文献调研的结果,我们得出结论:当前全自动化错误信息检测的最优水平在检测人工生成的错误信息方面效用有限。我们为评估机器学习在信任与安全问题上的应用提供建议,并指出未来研究方向。
引用
@article{arxiv.2308.12215,
title = {SoK: Machine Learning for Misinformation Detection},
author = {Madelyne Xiao and Jonathan Mayer},
journal= {arXiv preprint arXiv:2308.12215},
year = {2025}
}