澄清并不够:多轮问答中的后澄清答复仍是瓶颈
计算与语言
2026-05-26 v1
摘要
多元对齐需要系统适应不同用户的价值观、沟通方式和情境性假设。我们认为,这种对齐的基础前提是从用户意图在未明确或模糊时准确地征集偏好。我们研究了多轮问答中的偏好征集问题,通过将问题分解为两个组成部分:一个**澄清政策**,决定是提出澄清问题还是直接作答;以及**后澄清答复**,一旦提供缺失信息,产生正确的最终答案。我们使用PACIFIC基准显示,监督式微调能快速改善澄清政策,但即使模型采取正确的动作,最终答案准确率仍显著低下。这一差距表明,理解和正确解释用户响应是多轮问答系统中的关键缺口。
引用
@article{arxiv.2605.25204,
title = {Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA},
author = {Jinyan Su and Jennifer Healey},
journal= {arXiv preprint arXiv:2605.25204},
year = {2026}
}