超越单用户对话:评估大语言模型在多用户对话状态跟踪中的能力
计算与语言
2025-06-13 v1 人工智能
摘要
大语言模型(LLMs)在零样本对话状态跟踪(DST)中展现出惊人的性能,减少了对任务特定训练的需求。然而,当前的 DST 基准主要关注结构化的用户-代理对话,未能捕捉真实世界多用户交互的复杂性。本研究评估了 LLMs 在多用户 DST 中的鲁棒性,同时最小化数据集构建成本。我们受最新 LLM 数据标注进展的启发,通过基于言语行为理论生成第二个用户的言语来扩展现有的 DST 数据集。我们的 methodology 系统性地将第二个用户的言语纳入对话中,实现对 LLMs 在多用户环境下进行受控评估。实验结果显示,与单用户 DST 相比,LLMs 的性能显著下降,凸显了当前 LLMs 在多语者环境中提取和跟踪对话状态的局限性。我们的发现强调了未来研究需提升 LLMs 以适应多用户 DST 场景的必要性,为更真实和更稳健的 DST 模型铺平了道路。
引用
@article{arxiv.2506.10504,
title = {Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models},
author = {Sangmin Song and Juhwan Choi and JungMin Yun and YoungBin Kim},
journal= {arXiv preprint arXiv:2506.10504},
year = {2025}
}