基于 L1 正则最小二乘的无人机启用型 ISAC 中的流动天线
计算与语言
2026-05-27 v2 信息检索
摘要
搜索增强型大型语言模型(LLM)通过集成检索功能于生成任务中取得进展,相较于传统搜索系统降低了用户的认知负担。然而,这些系统仍不足以完全满足用户多样化需求,这需要识别同一查询在不同用户身下反映的不同意图,并按用户偏好形式提供信息。虽然近期诸如 ChatGPT 与 Gemini 等系统试图通过利用用户历史记录实现个性化,但系统性评估此类个性化仍受到忽视。为填补这一空白,我们提出 BESPOKE,一个用于评估搜索增强型大型语言模型个性化的真实基准测试。BESPOKE 旨在既真实又具诊断性,通过从人类直接收集真实聊天与搜索记录,同时将响应与细粒度偏好分数和反馈配对。该基准通过长期、深度参与的人类标注构建,标注者贡献自己的历史记录,撰写具有详细信息需求的查询,并对响应进行评分和诊断性反馈。利用 BESPOKE,我们进行系统性分析,揭示信息寻求任务中有效个性化的关键要求,为对个性化搜索增强型大型语言模型进行细粒度评估奠定基础。我们的代码与数据已公开于 https://augustinlib.github.io/BESPOKE/。
引用
@article{arxiv.2509.21106,
title = {BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback},
author = {Hyunseo Kim and Sangam Lee and Kwangwook Seo and Dongha Lee},
journal= {arXiv preprint arXiv:2509.21106},
year = {2026}
}
备注
Accepted to ICML 2026