时光针:通过自监督Plackett-Luce排序学习程序化工作流程
计算机视觉与模式识别
2026-03-24 v2 人工智能
摘要
程序化活动(从日常烹饪到复杂外科手术)是一系列以特定时间顺序执行的动作。尽管当前自监督学习(SSL)方法在静态图像和短片段上取得成功,但这些模型常常忽视此类活动的底层序列结构。我们通过一个激励实验揭示了这一缺陷:在正向序列和时间反转序列上预训练的模型会产生高度相似的特征,确认其表征对程序化顺序毫无感知能力。为此,我们提出了PL-Stitch—a 个基于Plackett-Luce(PL)模型的自监督框架,利用视频帧的内在时间顺序作为强监督信号。我们的方法整合了两个新颖的概率目标:主要PL目标训练模型对采样帧进行时间排序,迫使其学习全局工作流程的进程;次要目标(时空拼图损失)通过捕捉跨帧的细粒度物体对应关系来补充学习。我们的方法在五个外科和烹饪基准测试中 consistently 取得优异性能。具体而言,PL-Stitch在Cholec80数据集上实现了k-近邻准确率提升了+11.4百分点,在Breakfast数据集上线性探针准确率提升了+5.7百分点,证明其在程序化视频表征学习中的有效性。代码和模型已提供于https://github.com/visurg-ai/PL-Stitch。
引用
@article{arxiv.2511.17805,
title = {A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking},
author = {Chengan Che and Chao Wang and Xinyue Chen and Sophia Tsoka and Luis C. Garcia-Peraza-Herrera},
journal= {arXiv preprint arXiv:2511.17805},
year = {2026}
}
备注
Accepted at CVPR2026 main conference