基于因果发现与反事实推理优化说服性对话策略
计算与语言
2025-03-24 v1 人工智能
人机交互
摘要
针对用户定制说服性对话能够带来更有效的说服。然而,现有的对话系统往往难以适应动态演化的用户状态。本文提出了一种利用因果发现和反事实推理来优化系统说服能力和结果的新方法。我们采用最稀疏排列的贪心松弛(GRaSP)算法来识别用户与系统话语策略之间的因果关系,将用户策略视为状态,系统策略视为动作。GRaSP 识别出影响系统响应的用户策略作为因果因素,为双向条件生成对抗网络(BiCoGAN)生成系统反事实话语提供信息。随后,我们使用双 Dueling Double Deep Q-Network(D3QN)模型利用反事实数据来确定选择系统话语的最佳策略。我们在 PersuasionForGood 数据集上的实验表明,与基线方法相比,我们的方法在说服效果上有可衡量的提升。累积奖励和 Q 值的增加表明了因果发现在增强反事实推理和优化在线对话系统强化学习策略方面的有效性。
引用
@article{arxiv.2503.16544,
title = {Causal Discovery and Counterfactual Reasoning to Optimize Persuasive Dialogue Policies},
author = {Donghuo Zeng and Roberto Legaspi and Yuewen Sun and Xinshuai Dong and Kazushi Ikeda and Peter Spirtes and Kun Zhang},
journal= {arXiv preprint arXiv:2503.16544},
year = {2025}
}
备注
21 pages, 8 figures