中文

SalesSim:面向零售用户模拟器的多模态语言模型基准测试与对齐

计算与语言 2026-05-12 v1

摘要

我们提出SalesSim,一个用于评估多模态大语言模型(MLLM)在模拟现实、基于人格化客户行为方面能力的框架和基准测试。与以往将用户模拟视为表面级对话生成的工作不同,SalesSim将零售互动和决策建模为一种有 grounding、有主体性的过程,在此过程中,具有不同背景、偏好和dealbreaker的购物者与销售代理人互动、寻求澄清并做出明智的购买决定。为进行评估,我们设计了一套以决策对齐为中心的指标,衡量模拟器的行为与其人格规范之间的一致性,以及对话质量。我们发现,对6个开源和闭源最先进模型进行基准测试后存在若干行为差距。首先,尽管模型产生流畅的对话,但它们在词汇多样性和跨人格化露露信息方面显著低于人类对话。其二,模型倾向于被销售代理建议所说服,并偏离人格规范。即便是最强大的模型,其在 underlying 人格规范上的平均对齐度也不到79%。为克服这些限制,我们提出UserGRPO,这是一种多轮、多目标的强化学习配方,用于在人格规范下优化对话流畅性和决策对齐。我们的实验表明,UserGRPO将基线模型的决策对齐提升了13.8%,同时改善了对话质量。通过引入SalesSim,我们为社区提供了一个新的基准测试,以探索和改进以目标导向环境为目标的用户模拟器的遵循性。

关键词

引用

@article{arxiv.2605.08334,
  title  = {SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators},
  author = {Yada Pruksachatkun and Elaine Wan and Lyanna Chen and Kai-Wei Chang and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2605.08334},
  year   = {2026}
}