中文

一种高效的任务导向对话策略:由精英个体注入的进化强化学习

计算与语言 2025-06-06 v2

摘要

深度强化学习(DRL)被广泛用于优化任务导向对话系统中的对话策略,但由于状态和动作空间的高维性,它在探索与利用之间难以取得平衡。这一挑战往往导致局部最优或收敛不良。进化算法(EAs)已被证明能够通过维持种群多样性有效探索神经网络的解空间。受此启发,我们创新性地将 EA 的全局搜索能力与 DRL 的局部优化相结合,以实现探索与利用之间的平衡。然而,对话任务中自然语言的固有灵活性使这种直接集成变得复杂,导致进化时间延长。因此,我们进一步提出了一种精英个体注入机制,通过自适应地将表现最佳的个体引入种群来增强 EA 的搜索效率。在四个数据集上的实验表明,我们的方法显著改善了探索与利用之间的平衡,提升了性能。此外,EII 机制在减少探索时间方面的有效性已得到验证,实现了进化算法与深度强化学习在任务导向对话策略任务上的高效集成。

关键词

引用

@article{arxiv.2506.03519,
  title  = {An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals},
  author = {Yangyang Zhao and Ben Niu and Libo Qin and Shihan Wang},
  journal= {arXiv preprint arXiv:2506.03519},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main Track)