中文

RAIR:面向电商相关性评估的具备复杂长尾与视觉显著性子集的规则感知基准

信息检索 2026-02-24 v2 人工智能 计算与语言 机器学习

摘要

搜索相关性在网页电商中扮演核心角色。尽管大型语言模型(LLM)在相关性任务上显示出显著成果,但现有基准缺乏足够的复杂性,导致行业缺乏标准化的相关性评估指标。为此,我们提出了具备规则感知和图像支持的相关性评估基准(Rule-Aware benchmark with Image for Relevance assessment, RAIR),这是一个来自真实场景的中文数据集。RAIR 建立了标准化的相关性评估框架,提供一套通用规则,构成标准化评估的基础。此外,RAIR 分析了当前相关性模型所必需的关键能力,引入了由三个子集组成的全面数据集:(1)具有行业平衡抽样的通用子集,用于评估基本模型能力;(2)聚焦挑战性案例的长尾难子集,用于评估性能极限;(3)用于评估多模态理解能力的视觉显著性子集。我们使用 14 个开放和封闭源模型在 RAIR 上进行实验。结果表明,即便是 GPT-5(取得最佳成绩),在 RAIR 上也面临足够的挑战。RAIR 数据现已公开,作为相关性评估的行业基准,同时为一般语言模型和视觉语言模型(VLM)评估提供新见解。

关键词

引用

@article{arxiv.2512.24943,
  title  = {RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment},
  author = {Chenji Lu and Zhuo Chen and Hui Zhao and Zhenyi Wang and Pengjie Wang and Chuan Yu and Jian Xu},
  journal= {arXiv preprint arXiv:2512.24943},
  year   = {2026}
}