中文

基于画像感知的LLM裁判评估播客推荐

信息检索 2025-08-13 v1 人工智能 机器学习

摘要

评估个性化推荐仍然是一个核心挑战,尤其是在播客这类长音频领域,传统的离线指标存在曝光偏差,而A/B测试等在线方法成本高昂且操作受限。本文提出了一种新颖的框架,利用大语言模型(LLMs)作为离线裁判,以可扩展且可解释的方式评估播客推荐的质量。我们的两阶段画像感知方法首先从90天的收听历史中提炼出自然语言用户画像。这些画像总结了主题兴趣和行为模式,作为用户偏好的紧凑、可解释的表示。我们并非向LLM提供原始数据,而是利用这些画像提供高层次、语义丰富的上下文,使LLM能够更有效地推理用户兴趣与推荐剧集之间的匹配度。这降低了输入复杂性并提高了可解释性。随后,LLM被提示根据画像与剧集的匹配度,给出细粒度的逐点和成对判断。在一项有47名参与者参与的对照研究中,我们的画像感知裁判以高保真度匹配了人类判断,并且优于或匹配了使用原始收听历史的变体。该框架为推荐系统中的迭代测试和模型选择提供了高效、画像感知的评估方法。

关键词

引用

@article{arxiv.2508.08777,
  title  = {Evaluating Podcast Recommendations with Profile-Aware LLM-as-a-Judge},
  author = {Francesco Fabbri and Gustavo Penha and Edoardo D'Amico and Alice Wang and Marco De Nadai and Jackie Doremus and Paul Gigioli and Andreas Damianou and Oskar Stal and Mounia Lalmas},
  journal= {arXiv preprint arXiv:2508.08777},
  year   = {2025}
}

备注

Accepted at RecSys '25