HIPPO-Video:利用大语言模型模拟观看历史以实现个性化视频高光检测
计算机视觉与模式识别
2025-07-24 v1 人工智能
摘要
视频内容的指数级增长使得个性化视频高光检测成为一项重要任务,因为用户的偏好具有高度的易变性和复杂性。然而,现有的视频数据集通常缺乏个性化,依赖于孤立的视频或简单的文本查询,无法捕捉用户行为的复杂性。在本工作中,我们引入了 HIPPO-Video,一个用于个性化视频高光检测的新颖数据集,该数据集使用基于 LLM 的用户模拟器生成反映多样化用户偏好的真实观看历史。该数据集包含 2,040 个(观看历史,显著性得分)对,涵盖 170 个语义类别的 20,400 个视频。为了验证我们的数据集,我们提出了 HiPHer,一种利用这些个性化观看历史来预测偏好条件的分段显著性得分的方法。通过大量实验,我们证明我们的方法优于现有的通用和基于查询的方法,展示了其在真实场景中以高度以用户为中心进行视频高光检测的潜力。
引用
@article{arxiv.2507.16873,
title = {HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting},
author = {Jeongeun Lee and Youngjae Yu and Dongha Lee},
journal= {arXiv preprint arXiv:2507.16873},
year = {2025}
}
备注
Accepted to COLM2025