GISTBench:基于证据验证的用户兴趣理解基准测试
人工智能
2026-04-01 v1 计算与语言
摘要
我们提出 GISTBench,这是一个评估大型语言模型 (LLM) 理解用户能力的基准测试,重点考察其如何从互动历史中提取并验证用户兴趣。在推荐系统中,GISTBench 不同于传统 RecSys 基准测试——后者侧重于物品预测准确率——后者评估 LLM 能否从互动数据中提取并验证用户兴趣。我们提出了两个新型指标族:兴趣 grounding 指标 (IG),分解为精确率和召回率成分,分别惩罚幻觉的兴趣类别并奖励覆盖率;以及兴趣特异性指标 (IS),评估已验证的 LLM 预测用户轮廓的区分性。我们发布了一个构建于全球短视频平台真实用户互动数据上的合成数据集。该数据集包含隐式和显式的互动信号以及丰富的文本描述。我们对数据集的忠实性进行了用户调查验证,并评估了跨 7B 至 120B 参数规模的八个开源 LLM。我们的发现揭示了当前 LLM 的性能瓶颈,尤其是其在跨异构互动类型的计数和归因方面的有限能力。
关键词
引用
@article{arxiv.2603.29112,
title = {GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification},
author = {Iordanis Fostiropoulos and Muhammad Rafay Azhar and Abdalaziz Sawwan and Boyu Fang and Yuchen Liu and Jiayi Liu and Hanchao Yu and Qi Guo and Jianyu Wang and Fei Liu and Xiangjun Fan},
journal= {arXiv preprint arXiv:2603.29112},
year = {2026}
}
备注
9 figures, 20 tables; code at https://github.com/facebookresearch/GISTBench