中文

MICA:面向長期情感支持對話的多粒度跨時間信用分配

计算与语言 2026-05-06 v2 人工智能

摘要

強化學習 (RL) 在單回合任務中對大型語言模型 (LLM) 顯示出強大的性能,但擴展到多回合互動仍面臨稀疏獎勵和差勣的回合級信用分配挑戰。在情感支持對話中,回應塑造未來的用戶狀態,因而缺乏匹配狀態的逐回合比較,而軌跡級監督又不足以提供足夠指導。我們提出 MICA (Multi-granularity Intertemporal Credit Assignment),一種無評審 critic 的 RL 框架,用於多回合情感支持任務。MICA 從用於用戶結構化支持狀態的共享潛在函數中導出即時與遲發的信用。增量距離獎勵度量了每回合殘餘距離對目標狀態的減少,而其蒙特卡羅回報捕捉了遲發效應。在範圍特定的正規化後,這兩個信號形成混合優勢,用於無需匹配狀態比較、無需編排樹或學習評審的穩定逐回合優化。在 EMPA、EQ-Bench 和 EmoBench 上使用 Qwen2.5-7B-Instruct 以及 Qwen3-8B/14B/32B,MICA 均一致優於 GRPO 和 REINFORCE++,在 EMPA 上達到最高 +43.2 的提升,同時不增加編排成本且對獎勵評審保持穩定。這些結果表明,面向交互式 LLM 的回合級信用分配可實現有效且實用的多回合 RL。

关键词

引用

@article{arxiv.2603.06194,
  title  = {MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue},
  author = {Naifan Zhang and Ruihan Sun and Jinwei Su and Hengjie Yang and Zhengyuan Pan and Zhaohan Chen and Xiaofan Zhang},
  journal= {arXiv preprint arXiv:2603.06194},
  year   = {2026}
}