中文

REGEN:带自然语言批评与叙事的数据集与基准

计算与语言 2025-07-14 v2 人工智能 信息检索 机器学习

摘要

本文介绍了一个新型数据集 REGEN(Reviews Enhanced with GEnerative Narratives),旨在衡量基于协作式推荐的大语言模型(LLM)能力,既弥补了现有数据集主要聚焦于序列式物品预测的局限。REGEN 通过在 Amazon 产品评论数据集中插入两项关键自然语言特征来实现扩展:(1)用户批评,代表引导后续物品选择的查询;(2)叙事,涉及每项推荐物品的丰富文本输出,综合了先前的上下文。叙事包括产品推荐、购买解释以及用户偏好总结。进一步,我们建立了一个端到端建模基准,用于协作式推荐任务,模型在训练时需生成推荐及相应的叙事,条件化于用户历史记录(物品与批评)。针对这一联合任务,我们引入了建模框架 LUMEN(LLM-based Unified Multi-task Model with Critiques, Recommendations, and Narratives),其使用 LLM 作为主干进行批评、检索与生成。我们还通过标准的自动评估技术评估了数据集质量,并通过训练传统模型和 LLM 推荐模型对其进行基准测试。我们的结果表明,融入批评能提升推荐质量,通过使推荐系统学习语言理解并将其与推荐信号集成来实现。此外,训练本数据集的 LLMs 能有效生成推荐及其上下文叙事,性能与最先进的推荐模型和语言模型相当。

关键词

引用

@article{arxiv.2503.11924,
  title  = {REGEN: A Dataset and Benchmarks with Natural Language Critiques and Narratives},
  author = {Kun Su and Krishna Sayana and Hubert Pham and James Pine and Yuri Vasilevski and Raghavendra Vasudeva and Marialena Kyriakidi and Liam Hebert and Ambarish Jash and Anushya Subbiah and Sukhdeep Sodhi},
  journal= {arXiv preprint arXiv:2503.11924},
  year   = {2025}
}