中文

“解释是合理的”:关于 LLM 在新闻分类及其对人类- AI 协同标注影响的实证研究

人机交互 2026-02-24 v1

摘要

媒体偏见的扩散是一重大关切,因其影响观点与信念的形成。从计算层面解决此挑战需提升新闻解释方法。虽然大型语言模型 (LLM) 能够实现分类任务的规模化,但其可信度仍存疑虑。为推进人机协作,本文考察使用 LLM 对美国新闻按政治意识形态进行分类的可行性,并检验其对用户决策的影响。首先我们将 GPT 模型与提示工程与最新监督式机器学习方法在 34k 条公共数据集上进行比较。随后我们收集 17k 条新闻,测试 GPT-4 的预测结果及其简要与详尽解释。在众subject研究中 (N=124),我们评估 LLM 生成的解释如何影响人类标注、判断及自信程度。结果显示,AI 辅导显著提升自信程度 (p<.001),其中详尽解释更具说服力且更可能改变决策。我们通过主题分析提供 AI 解释的建议,并提供数据集供后续研究使用。

关键词

引用

@article{arxiv.2602.19690,
  title  = {"The explanation makes sense": An Empirical Study on LLM Performance in News Classification and its Influence on Judgment in Human-AI Collaborative Annotation},
  author = {Qile Wang and Prerana Khatiwada and Avinash Chouhan and Ashrey Mahesh and Joy Mwaria and Duy Duc Tran and Kenneth E. Barner and Matthew Louis Mauriello},
  journal= {arXiv preprint arXiv:2602.19690},
  year   = {2026}
}