CLIPTime:从图像和文本中进行时间感知的多模态表示学习
计算机视觉与模式识别
2025-08-04 v1 机器学习
摘要
理解生物生长的时序动态在微生物学、农业和生物降解研究等多个领域都至关重要。尽管视觉语言模型如对比语言图像预训练(CLIP)在联合视觉-文本推理方面显示出强大的能力,但其在捕捉时序进程方面的效果仍有限。为此,我们提出了 CLIPTime,一个用于从图像和文本输入预测真菌生长发育阶段和相应时间戳的多模态、多任务框架。基于 CLIP 架构,our模型学习联合视觉-文本嵌入,实现无需在测试时显式输入时间信息即可进行时序感知推断。为便于训练和评估,我们引入了一个带有对齐时间戳和类别阶段标签的合成真菌生长数据集。CLIPTime 同时完成分类和回归,预测离散生长阶段及连续时间戳。我们还提出了包括时序准确性和回归误差在内的自定义评估指标,以衡量时序感知预测的精度。实验结果表明,CLIPTime 有效地建模了生物进程,产生可解释且时序导向的输出,凸显了视觉语言模型在实际生物监测应用中的潜力。
引用
@article{arxiv.2508.00447,
title = {CLIPTime: Time-Aware Multimodal Representation Learning from Images and Text},
author = {Anju Rani and Daniel Ortiz-Arroyo and Petar Durdevic},
journal= {arXiv preprint arXiv:2508.00447},
year = {2025}
}
备注
11 pages, 8 figures