中文

学习说谎:强化学习攻击损害人类-AI团队及LLM团队

人机交互 2025-04-04 v2 社会与信息网络

摘要

随着人工智能(AI)助手在安全关键领域的广泛采用,发展针对潜在故障或对手攻击的防御措施变得至关重要。 developing these safeguards 的关键前提是理解AI助手误导人类同伴的能力。我们在一个知识型策略游戏中研究了这一问题,该游戏中由三名人类和一名AI助手组成的团队协作回答一系列常识问题。在人类未察觉的情况下,AI助手充当对手。利用基于模型的强化学习(MBRL)技术,AI助手学习人类信任演化的模型,并利用该模型操控团队决策过程以损害团队。我们评估了两种模型——一种受文献启发,另一种数据驱动——发现两者均能有效损害人类团队。此外,我们发现该数据驱动模型能够准确预测在有限的先前交互信息下,人类代理如何评估其同伴。最后,我们将最新SOTA LLM模型与人类代理在影响分配任务上进行比较,以评估LLM是否以类似人类的方式分配影响力,或者它们是否对我们的攻击更具鲁棒性。这些结果增进了对小型人类-AI团队中决策动态的理解,为防御策略奠定了基础。

关键词

引用

@article{arxiv.2503.21983,
  title  = {Learning to Lie: Reinforcement Learning Attacks Damage Human-AI Teams and Teams of LLMs},
  author = {Abed Kareem Musaffar and Anand Gokhale and Sirui Zeng and Rasta Tadayon and Xifeng Yan and Ambuj Singh and Francesco Bullo},
  journal= {arXiv preprint arXiv:2503.21983},
  year   = {2025}
}

备注

17 pages, 9 figures, accepted to ICLR 2025 Workshop on Human-AI Coevolution