语言模型并不知道你想要什么:深度研究中的个性化评估需要真实用户
计算与语言
2026-04-21 v2
摘要
深度研究 (DR) 系统帮助研究者应对日益增长的论文数量。此类工具综合科学论文以回答研究查询,但缺乏对用户的理解。我们通过 MyScholarQA (MySQA) 提出了解决方案,该系统具备以下功能:1) 推断用户研究兴趣的个人轮廓;2) 为用户输入的查询提出个性化行动;3) 编写遵循用户批准行动的多章节报告。我们首先使用 NLP 的标准协议进行测试:构建包含合成用户和 LLM 评判器的基准数据集,其中 MySQA 在引用指标和个人化行动遵循方面超越基线方法。然而,我们怀疑此过程未能覆盖个人化 DR 用户所看重的所有方面,因此我们对线上版 MySQA 进行用户访谈,以揭示其本质。我们揭示了九项无法被 LLM 评判器检测到的个性化 DR 细微错误,并通过定性反馈形成未来 DR 设计的经验教训。总之,我们主张个性化的一个支柱:只有借助真实用户,才能在 NLP 中实现个性化的真实进展。
引用
@article{arxiv.2603.16120,
title = {Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users},
author = {Nishant Balepur and Malachi Hamada and Varsha Kishore and Sergey Feldman and Amanpreet Singh and Pao Siangliulue and Joseph Chee Chang and Eunsol Choi and Jordan Lee Boyd-Graber and Aakanksha Naik},
journal= {arXiv preprint arXiv:2603.16120},
year = {2026}
}
备注
ACL 2026