DyBBT:基于强盗启发式目标的对话策略动态平衡与认知双系统
计算与语言
2026-04-15 v3 人工智能
信息检索
摘要
任务导向对话系统通常依赖不随动态对话上下文适应的静态探索策略,导致探索效率低下和性能次优。我们提出 DyBBT,一个新颖的对话策略学习框架,通过捕捉对话进展、用户不确定性和槽位依赖的结构化认知状态空间来形式化探索挑战。DyBBT 提出了一种基于强盗的元控制器,根据实时认知状态和访问次数,在快速直觉推理(系统 1)和缓慢审慎推理器(系统 2)之间动态切换。在单域和多域基准上的大量实验表明,DyBBT 在成功率、效率和泛化性方面达到了最先进的性能,人类评估也证实其决策与专家判断高度一致。
引用
@article{arxiv.2509.19695,
title = {DyBBT: Dynamic Balance via Bandit-inspired Targeting for Dialog Policy with Cognitive Dual-Systems},
author = {Shuyu Zhang and Yifan Wei and Jialuo Yuan and Xinru Wang and Yanmin Zhu and Bin Li and Yujie Liu},
journal= {arXiv preprint arXiv:2509.19695},
year = {2026}
}
备注
Accepted in ACL2026 main