面向多轮交互的大语言模型测试时策略适应
计算与语言
2026-03-03 v2
摘要
大型语言模型(LLM)采用多轮交互作为完成复杂任务的基本范式,但在扩展交互过程中,其性能常会下降,因为它们通常在静态、单轮数据上训练,限制了其适应实时用户反馈的能力。为此,我们首先提出一种新范式:面向多轮交互的测试时策略适应(T2PAM),该范式利用持续交互中的用户反馈作为奖励信号,以估计与用户偏好相匹配的潜在最优策略,然后更新模型的小子集参数,以引导模型趋向该策略,从而实现高效的对话自我纠正。我们随后引入单步最优参考适应(Optimum-Referenced One-Step Adaptation, ROSA)——一种轻量级算法,将T2PAM实际化。ROSA通过单次高效更新步骤将模型参数引导至理论最优策略,避免了昂贵的迭代梯度优化,最小化了计算开销。我们提供了严格的理论分析,保证ROSA的策略在交互次数增加时收敛至用户偏好。大量实验表明,ROSA在挑战性基准测试上显著提升了任务有效性和效率。
引用
@article{arxiv.2509.23166,
title = {Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs},
author = {Chenxing Wei and Hong Wang and Ying He and Fei Yu and Yao Shu},
journal= {arXiv preprint arXiv:2509.23166},
year = {2026}
}
备注
32 pages, 7 figures