DZ-TDPO:面向长上下文对话中的可变状态跟踪的非破坏性时间对齐
计算与语言
2025-12-09 v2
摘要
长上下文对话系统存在状态惯性问题,即静态约束阻止模型解决用户意图不断演变与已建立历史上下文之间的冲突。为解决此问题,我们提出 DZ-TDPO,一种非破坏性对齐框架,融合冲突感知的动态 KL 约束与校准的时间注意力偏置。在 Multi-Session Chat (MSC) 数据集上的实验表明,DZ-TDPO 在 Phi-3.5 上实现了最高的获胜率 (55.4%),同时保持稳健的零样本泛化能力。我们的规模分析揭示了一种“容量-稳定性权衡”:虽然较小的模型需要付出“对齐税”(困惑度飙升)来克服历史惯性,但更大的 Qwen2.5-7B 模型在几乎没有困惑度开销的情况下实现了 50.8% 的获胜率。这一发现表明,TAI 可通过精确的注意力调控来缓解,而无需破坏性地更新权重,从而在不同模型规模下保持通用能力 (MMLU)。代码和数据已公开:https://github.com/lyj20071013/DZ-TDPO
引用
@article{arxiv.2512.03704,
title = {DZ-TDPO: Non-Destructive Temporal Alignment for Mutable State Tracking in Long-Context Dialogue},
author = {Yijun Liao},
journal= {arXiv preprint arXiv:2512.03704},
year = {2025}
}
备注
25 pages, 3 figures, 17 tables. Code available at https://github.com/lyj20071013/DZ-TDPO