AllSERP:对 AdSERP 数据集进行彻底的逐元素丰富
信息检索
2026-05-20 v2
摘要
我们发布 AllSERP,对 AdSERP 商业意图 SERP 语料库[4]进行类型化且逐元素行为丰富。AdSERP 提供 2776 组完整页面截图、捕获的 SERP HTML、150 Hz Gazepoint 眼动追踪、evtrack 鼠标遥测、滚动和瞳孔信号,对真实 Google SERP 进行收集——但其边界框仅覆盖广告区域(仅占可归因点击的15.5%)。AllSERP 通过屏幕截图锚定的计算机视觉方法添加了像素级的有机区域和小部件边界框,通过 HTML 解析器获取 13 种元素类型的语义类型,引入一种用于填充 inter-result 间隙的口味(typed_gapfill),并实现 X+Y 点击归因,覆盖语料库的91.7%,同时在 trial 级别标记其余部分。Phase C 的广告与非广告划分在内部与提供的广告矩形一致(38,250 项分类中无不一致之处)。我们提供管道、每个 trial 的 JSON 文件、语料库 CSV 文件以及基于浏览器的回放查看器;所有内容均可从 AdSERP Zenodo 卷中复现。此版本释放使得能够进行 per-element click、fixation、regression 和 above-fold 分析,而原装的广告与有机区域划分无法解决。
引用
@article{arxiv.2605.04949,
title = {AllSERP: Exhaustive Per-Element Enrichment of the Versatile AdSERP Dataset},
author = {K. Andrew Edmonds},
journal= {arXiv preprint arXiv:2605.04949},
year = {2026}
}