基于舌尖现象检索查询的无监督记忆性建模
计算机视觉与模式识别
2025-11-27 v1 人工智能
计算与语言
摘要
视觉内容的可记忆性数十年来一直吸引着科学界,其应用范围广泛,从理解人类记忆的细微方面到增强内容设计。推动该领域发展的一个重大挑战在于收集人类记忆性标注的昂贵过程。这限制了用于建模视觉内容记忆性的数据集的多样性和可扩展性。大多数现有数据集仅限于收集视觉内容的聚合记忆性分数,未能捕捉到自然、开放式回忆描述中存在的细微记忆性信号。在这项工作中,我们引入了首个明确设计用于建模视觉记忆性信号的大规模无监督数据集,包含超过 82,000 个视频,并附带描述性回忆数据。我们利用了来自 Reddit 等在线平台的舌尖现象(ToT)检索查询。我们证明,我们的无监督数据集为两个与记忆性相关的任务提供了丰富的信号:回忆生成和 ToT 检索。在我们的数据集上微调的大型视觉-语言模型在生成视觉内容的开放式记忆性描述方面优于 GPT-4o 等最先进的模型。我们还采用对比训练策略,创建了首个能够执行多模态 ToT 检索的模型。我们的数据集和模型呈现了一个新颖的方向,促进了视觉内容记忆性研究的进展。
引用
@article{arxiv.2511.20854,
title = {Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval Queries},
author = {Sree Bhattacharyya and Yaman Kumar Singla and Sudhir Yarram and Somesh Kumar Singh and Harini S and James Z. Wang},
journal= {arXiv preprint arXiv:2511.20854},
year = {2025}
}
备注
Accepted at WACV 2026