MM-tau-p$^2$: 面向双控制场景下带人格适应的多模态智能体评估
新兴技术
2026-04-17 v5 人工智能
摘要
当前针对 LLM 驱动智能体的评估框架和基准仅聚焦文本聊天式智能体,这些框架未向智能体暴露用户人格,从而在用户中性环境中运行。重要的是,在客户体验管理领域,智能体的行为会随其对用户人格的了解而演变。随着实时语音合成和多模态语言模型的普及,基于 LLM 的智能体正逐步变为多模态。为此,我们提出 MM-tau-p 基准,提供评估多模态智能体在双控制场景下(带或不带用户人格适应)的鲁棒性指标,同时将用户输入纳入规划过程以解决用户查询。具体而言,我们的工作表明,即使在 GPT-5、GPT-4.1 等最先进的前沿 LLM 上,引入多模态还需额外考虑:多模态鲁棒性、引入多模态后的延迟开销。总体而言,MM-tau-p 基于我们的前期工作 FOCAL,提供一种通过引入 12 项新指标来自动评估多模态智能体的全面方法。我们还使用 LLM 作为评判器,结合精心设计的提示语和明确定义的评分标准,对 telecom 和 retail 领域的指标进行评估。
引用
@article{arxiv.2603.09643,
title = {MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings},
author = {Anupam Purwar and Aditya Choudhary},
journal= {arXiv preprint arXiv:2603.09643},
year = {2026}
}
备注
A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios