PQPP:面向文本到图像提示与查询性能预测的联合基准
计算机视觉与模式识别
2025-03-19 v2 人工智能
计算与语言
机器学习
摘要
文本到图像生成近期已成为文本到图像检索的可行替代方案,这得益于生成扩散模型在视觉上令人印象深刻的结果。尽管查询性能预测是信息检索中的一个活跃研究课题,但据我们所知,此前尚无研究基于人类判断分析文本到图像生成中查询(称为提示)的难度。为此,我们引入了首个手动注释图像生成性能的提示数据集。此外,我们通过收集代表检索性能的手动注释,将这些评估扩展到文本到图像检索。因此,我们建立了首个面向提示和查询性能预测(PQPP)的联合基准,涵盖两项任务,包含超过10K个查询。该基准使得能够(i)比较评估图像生成和图像检索中的提示/查询难度,以及(ii)评估针对生成和检索的提示/查询性能预测器。我们评估了几种生成前/后和检索前/后的性能预测器,从而为未来研究提供了有竞争力的基线。我们的基准和代码公开于https://github.com/Eduard6421/PQPP。
引用
@article{arxiv.2406.04746,
title = {PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction},
author = {Eduard Poesina and Adriana Valentina Costache and Adrian-Gabriel Chifu and Josiane Mothe and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2406.04746},
year = {2025}
}
备注
Accepted at CVPR 2025