DRACULA:探寻深度研究代理应执行的用户期望动作
计算与语言
2026-04-28 v1
摘要
科学深度研究(DR)代理通过综合研究论文生成多章节报告来回答用户查询。用户反馈可以提高其实用性,但现有协议仅对最终报告进行评分,难以研究和学习DR代理应采取哪些中间动作以提高报告质量。我们收集了DRACULA,这是第一个包含用户对中间动作反馈的数据集,用于DR。在五周的时间里,19名专家计算机科学研究人员向DR系统提出查询,系统提出动作(例如:“添加关于数据集的章节”)。用户选择他们偏好的动作,然后判断所选输出报告的成功执行情况,从而获得8,103条动作偏好和5,230条执行判断。确认DR代理能够执行DRACULA的动作后,我们研究了用户偏好动作的可预测性——即通过仿真来预测LLM预测用户所选动作的水平——这是学习生成有用动作的一步。我们发现:(1)LLM裁判器最初难以预测动作选择,但在使用用户的完整选择历史记录时(而非自我报告或外推的用户情境信号)能够获得最大改进;(2)基于未明示目标,用户对相同查询的选择存在差异,这成为仿真的瓶颈,动机在于提供让用户引导报告的功能;(3)我们的仿真结果指导了一个在线干预,生成基于用户过去互动的新动作,这些动作在后续研究中最常被用户选中。总体而言,虽然工作广泛研究执行,但DRACULA揭示了决定首先执行哪些动作的关键挑战。我们开源DRACULA的研究设计、用户反馈和仿真任务,以鼓励未来在长期代理动作反馈方面的工作。
引用
@article{arxiv.2604.23815,
title = {DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute},
author = {Nishant Balepur and Malachi Hamada and Varsha Kishore and Sergey Feldman and Amanpreet Singh and Pao Siangliulue and Joseph Chee Chang and Rachel Rudinger and Eunsol Choi and Jordan Lee Boyd-Graber and Doug Downey and Aakanksha Naik},
journal= {arXiv preprint arXiv:2604.23815},
year = {2026}
}
备注
In-progress Preprint