中文

探索AI响应的人类感知:来自混合方法研究的洞察:面向生成模型风险缓解

计算与语言 2025-12-02 v1 人工智能 人机交互

摘要

随着生成式AI的快速普及,调查人们对生成响应的感知已至关重要。一个主要挑战是它们在生成有害内容方面具有欺骗性。尽管已通过实施防线努力,但人们对这些缓解策略的感知仍大多未知。我们进行了混合方法实验,评估了缓解策略在多个维度上的响应效果:忠实性、公平性、伤害移除能力和相关性。在within-subject研究设计中,57名受试者评估了两种条件下的响应:有害响应及其缓解措施,以及仅缓解的响应。结果显示,受试者的母语、AI工作经验和标注熟悉度显著影响评估。受试者对语言和上下文属性表现出高度敏感性,对轻微语法错误进行惩罚,同时奖励保存语义上下文。这与语言在LLM定量评估中的处理方式形成鲜明对比。我们还引入了用于训练和评估缓解策略的新指标,并提供了人机评估研究的见解。

关键词

引用

@article{arxiv.2512.01892,
  title  = {Exploring Human Perceptions of AI Responses: Insights from a Mixed-Methods Study on Risk Mitigation in Generative Models},
  author = {Heloisa Candello and Muneeza Azmat and Uma Sushmitha Gunturi and Raya Horesh and Rogerio Abreu de Paula and Heloisa Pimentel and Marcelo Carpinette Grave and Aminat Adebiyi and Tiago Machado and Maysa Malfiza Garcia de Macedo},
  journal= {arXiv preprint arXiv:2512.01892},
  year   = {2025}
}

备注

16 pages, 2 figures, 6 tables. Under review for publication