中文

通过事实性分数和来源归因促进人-大语言模型协作

人机交互 2024-06-03 v1 人工智能

摘要

虽然人类越来越依赖大型语言模型(LLM),但它们容易生成不准确或虚假的信息,也称为“幻觉”。在算法方面已经取得了技术进展,这些算法通过评估模型响应的事实性并将响应的部分归因于特定源文档来检测幻觉内容。然而,关于如何有效地将这些信息传达给用户,以帮助他们适当校准对LLM的信任度的研究有限。为了解决这个问题,我们进行了一项基于场景的研究(N=104),系统地比较了传达事实性和来源归因的各种设计策略对参与者信任度、偏好和验证响应准确性难易程度评分的影响。我们的研究结果显示,参与者更喜欢一种设计,其中响应中的短语根据计算出的真实性分数进行颜色编码。此外,与在源材料中没有收到任何注释相比,当源材料的相关部分被高亮显示或响应被注释有对应于这些来源的参考编号时,参与者提高了他们的信任度评分。我们的研究提供了实用的设计指南,以促进人-LLM协作,并倡导一种新的人类角色,即仔细评估并对其使用LLM输出负责。

关键词

引用

@article{arxiv.2405.20434,
  title  = {Facilitating Human-LLM Collaboration through Factuality Scores and Source Attributions},
  author = {Hyo Jin Do and Rachel Ostrand and Justin D. Weisz and Casey Dugan and Prasanna Sattigeri and Dennis Wei and Keerthiram Murugesan and Werner Geyer},
  journal= {arXiv preprint arXiv:2405.20434},
  year   = {2024}
}

备注

Submitted to the Trust and Reliance in Evolving Human-AI Workflows (TREW) Workshop at CHI 2024