中文

建模多模态 AI 内容的人类反应

人工智能 2025-08-15 v1 多媒体

摘要

随着 AI 生成内容的广泛应用,误信息的风险也随之增加。虽然先前的研究主要关注识别内容是否为真实,但关于此类内容如何影响人类感知和行为的了解仍很少。在像交易或股票市场这样的领域,预测人们的反应(例如,新闻帖子是否会走红)比验证其事实准确性更为关键。为此,我们采取以人类为中心的方法,引入 MhAIM 数据集,其中包含 154,552 篇在线帖子(其中 111,153 篇为 AI 生成),使我们能够对人类对 AI 生成内容的反应进行大规模分析。我们的研究发现,当帖子包含文本和视觉内容时,人们更擅长识别 AI 内容,特别是当两种内容之间存在不一致时。我们提出了三个新指标:可信度、影响力和开放性,用于量化用户如何判断和参与在线内容。我们提出了 T-Lens,一个基于大语言模型 (LLM) 的智能体系统,用于通过整合对多模态信息的人类反应预测来回答用户查询。在其核心是 HR-MCP(Human Response Model Context Protocol),它建立在标准化的模型上下文协议 (MCP) 之上,实现与任何 LLM 的无缝集成。这种集成使 T-Lens 能够更好地与人类反应保持一致,从而增强可解释性和交互能力。我们的工作提供了实证见解和实用工具,使大语言模型具备人类意识能力。通过突出 AI、人类认知和信息接收之间复杂的相互作用,我们的发现表明了缓解 AI 驱动误信息风险的可行策略。

关键词

引用

@article{arxiv.2508.10769,
  title  = {Modeling Human Responses to Multimodal AI Content},
  author = {Zhiqi Shen and Shaojing Fan and Danni Xu and Terence Sim and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2508.10769},
  year   = {2025}
}