中文

面向用户对齐 LLM 响应在线评估与选择的多智能体会话 Bandit 方法

人机交互 2025-11-12 v2 人工智能

摘要

基于提示的离线方法通常用于优化大语言模型(LLM)响应,但评估这些响应计算量大,且往往难以适应多样化的响应风格。本研究引入了一种新颖的在线评估框架,该框架采用多智能体会话 bandit 模型来选择最优响应,同时动态地与用户偏好保持对齐。为了应对高维特征、大响应集、自适应会话需求和多设备访问等挑战,我们提出了 MACO(多智能体会话在线学习),它包含两个关键组件:(1) \texttt{MACO-A}:由本地智能体执行,采用在线淘汰机制过滤低质量响应。(2) \texttt{MACO-S}:由云服务器执行,根据聚合的偏好数据自适应地调整选择策略。自适应偏好机制触发异步会话以提高对齐效率。理论分析表明,MACO 实现了近乎最优的遗憾界,在各种退化情形下匹配了 SOTA 性能。利用 Google 和 OpenAI 文本嵌入模型在不同响应风格的真实数据集上进行的广泛实验,结合 Llama 和 GPT-4o,表明 MACO 在不同的响应集大小和智能体数量下,始终比基线方法高出至少 8.29%。

关键词

引用

@article{arxiv.2501.01849,
  title  = {A Multi-Agent Conversational Bandit Approach to Online Evaluation and Selection of User-Aligned LLM Responses},
  author = {Xiangxiang Dai and Yuejin Xie and Maoli Liu and Xuchuang Wang and Zhuohua Li and Huanyu Wang and John C. S. Lui},
  journal= {arXiv preprint arXiv:2501.01849},
  year   = {2025}
}

备注

Accepted by AAAI 2026