面向内容感知点播与直播的 LLM 指导视频显著性框架
计算机视觉与模式识别
2026-02-17 v1
摘要
内容感知流式传输需要动态的、分块级别的重要性权重,以优化主观的质量体验 (QoE)。然而,直接的人类标注成本 prohibitive,而视觉显著性模型泛化效果不佳。我们提出 HiVid,首个利用大语言模型 (LLM) 作为可扩展的人类代理,为点播 (VOD) 和直播生成高保真权重的框架。我们解决了 3 个非平凡挑战:(1) 为了扩展 LLM 的有限模态性并规避 token 限制,我们提出感知模块,在局部上下文窗口内评估帧,autoregressively 构建对视频的连贯理解。(2) 对于 VOD 存在局部窗口内评级不一致的情况,我们提出排序模块,通过一种新颖的 LLM 指导合并排序算法进行全局重排序。(3) 对于需要低延迟、在线推理且无需未来知识的直播,我们提出预测模块,通过一种多模态时间序列模型预测未来权重,包括内容感知注意力和自适应窗口,以适应异步 LLM 推理。大量实验表明,HiVid 在 SOTA baseline 上将 VOD 的权重预测准确率提高最高可达 11.5%,直播提高 26%。真实世界的用户研究验证,HiVid 将流式 QoE 相关性提升 14.7%。
引用
@article{arxiv.2602.14214,
title = {HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming},
author = {Jiahui Chen and Bo Peng and Lianchen Jia and Zeyu Zhang and Tianchi Huang and Lifeng Sun},
journal= {arXiv preprint arXiv:2602.14214},
year = {2026}
}
备注
ICLR 2026