中文

AI-LieDar:审视 LLM 智能体中效用与真实性的权衡

人工智能 2025-04-29 v2 计算与语言

摘要

真实性(遵循事实准确性)和效用(满足人类需求和指令)都是大语言模型的基本方面,然而这些目标常常相互冲突(例如,出售一辆已知有缺陷的汽车),这使得在现实世界部署中同时实现两者颇具挑战。我们提出了 AI-LieDar,一个用于研究基于 LLM 的代理如何在多轮交互环境中应对这些场景的框架。我们设计了一组现实世界场景,其中语言代理被指示在与模拟人类代理的多轮对话中实现与真实性相冲突的目标。为了大规模评估真实性,我们开发了一个受心理学文献启发的真实性检测器来评估代理的响应。我们的实验表明,所有模型在超过 50% 的时间里都不够真实,尽管真实性和目标达成(效用)率因模型而异。我们进一步测试了 LLM 朝向真实性的可操控性,发现模型可以被引导变得真实或具有欺骗性,甚至被引导向真实的模型仍然会说谎。这些发现揭示了 LLM 中真实性的复杂本质,并强调了进一步研究以确保 LLM 及基于 LLM 的代理安全可靠部署的重要性。

关键词

引用

@article{arxiv.2409.09013,
  title  = {AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents},
  author = {Zhe Su and Xuhui Zhou and Sanketh Rangreji and Anubha Kabra and Julia Mendelsohn and Faeze Brahman and Maarten Sap},
  journal= {arXiv preprint arXiv:2409.09013},
  year   = {2025}
}