中文

Rel-A.I.: 衡量人类-大语言模型依赖关系的交互中心方法

计算与语言 2024-10-04 v2 人工智能 人机交互

摘要

与大型语言模型(LLM)交互时,能够准确表达不确定性、风险和局限性对于确保其安全性至关重要。然而,当前对这些能力的评估依赖于简单的校准,即询问所生成语言是否符合适当的概率。相反,对 LLM 沟通这一方面应聚焦于其人类交际者的行为:他们对 LLM 所述内容的依赖程度如何。我们引入一种称为 Rel-A.I.(读作 "rely")的交互中心评估框架,用于衡量人类是否依赖 LLM 的生成内容。我们运用该框架研究依赖受哪些情境特征的影响(例如讨论的知识领域),或使用传递温暖或能力信息的问候语(例如 "我很乐意帮助您!")的使用情况。我们发现,情境特征显著影响人类依赖行为。例如,在涉及计算问题的提问时,人们对 LLM 的依赖程度高出约 10%;当 LLM 被认为更具专业能力时,人们的依赖程度高出约 30%。我们的结果表明,校准和语言质量alone 对于评估人类-LM 交互风险是不够的,说明我们需要考虑交互情境的特征。

关键词

引用

@article{arxiv.2407.07950,
  title  = {Rel-A.I.: An Interaction-Centered Approach To Measuring Human-LM Reliance},
  author = {Kaitlyn Zhou and Jena D. Hwang and Xiang Ren and Nouha Dziri and Dan Jurafsky and Maarten Sap},
  journal= {arXiv preprint arXiv:2407.07950},
  year   = {2024}
}

备注

Preprint