TempViz:关于文本到图像模型中时间知识评估的研究
计算机视觉与模式识别
2026-01-22 v1 人工智能
计算与语言
摘要
时间改变了我们世界中实体(如物体、地点和动物)的视觉外观。因此,为了准确地生成与上下文相关的图像,关于时间的知识和推理可能是至关重要的(例如,生成春季与冬季的风景)。然而,尽管在理解和改进自然语言处理中的时间知识方面存在大量工作,但关于时间现象如何在文本到图像(T2I)模型中出现并被处理的研究仍然很少。我们用 TempViz 来填补这一空白,这是首个全面评估图像生成中时间知识的数据集,包含 7.9k 个提示词和超过 600 张参考图像。使用 TempViz,我们研究了五个 T2I 模型在五个时间知识类别上的能力。人工评估表明,时间能力普遍较弱,没有模型在各个类别上的准确率超过 75%。为了进行更大规模的研究,我们还检查了自动评估方法,将几种现有方法与人类判断进行了比较。然而,这些方法都没有提供对时间线索的可靠评估——这进一步表明,未来迫切需要对 T2I 中时间知识的研究。
关键词
引用
@article{arxiv.2601.14951,
title = {TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models},
author = {Carolin Holtermann and Nina Krebs and Anne Lauscher},
journal= {arXiv preprint arXiv:2601.14951},
year = {2026}
}