CURATe:面向对话式 AI 助手个性化对齐的基准评测
人机交互
2025-01-31 v2 人工智能
摘要
我们引入了一个多轮次基准,用于评估基于大语言模型(LLM)的 AI 助手在个性化对齐方面的表现,重点关注其处理用户提供的安全关键上下文的能力。我们对十个领先模型在五个场景(每个场景含 337 个用例)中的评估揭示了在维持用户特定考量方面存在系统性的不一致,即便是评级最高的“无害”模型,在给定上下文的情况下,也会做出对用户明显有害的推荐。关键的失效模式包括:对冲突偏好的不当权衡、谄媚行为(将用户意愿置于安全之上)、对上下文窗口内关键用户信息缺乏关注,以及用户特定知识应用的不一致。在 OpenAI 的 o1 模型中也观察到了相同的系统性偏差,这表明强大的推理能力并不一定会迁移到这种个性化思考中。我们发现,与通用的“无害且有益”指令不同,提示 LLM 考虑安全关键上下文能显著提升性能。基于这些发现,我们提出了在 AI 助手中嵌入自我反思能力、在线用户建模和动态风险评估的研究方向。我们的工作强调了在为持久人机交互设计的系统中,需要采用细致入微、上下文感知的对齐方法,以助力开发安全且体贴的 AI 助手。
引用
@article{arxiv.2410.21159,
title = {CURATe: Benchmarking Personalised Alignment of Conversational AI Assistants},
author = {Lize Alberts and Benjamin Ellis and Andrei Lupu and Jakob Foerster},
journal= {arXiv preprint arXiv:2410.21159},
year = {2025}
}