中文

PQPP:面向文本到图像提示与查询性能预测的联合基准

计算机视觉与模式识别 2025-03-19 v2 人工智能 计算与语言 机器学习

摘要

文本到图像生成近期已成为文本到图像检索的可行替代方案,这得益于生成扩散模型在视觉上令人印象深刻的结果。尽管查询性能预测是信息检索中的一个活跃研究课题,但据我们所知,此前尚无研究基于人类判断分析文本到图像生成中查询(称为提示)的难度。为此,我们引入了首个手动注释图像生成性能的提示数据集。此外,我们通过收集代表检索性能的手动注释,将这些评估扩展到文本到图像检索。因此,我们建立了首个面向提示和查询性能预测(PQPP)的联合基准,涵盖两项任务,包含超过10K个查询。该基准使得能够(i)比较评估图像生成和图像检索中的提示/查询难度,以及(ii)评估针对生成和检索的提示/查询性能预测器。我们评估了几种生成前/后和检索前/后的性能预测器,从而为未来研究提供了有竞争力的基线。我们的基准和代码公开于https://github.com/Eduard6421/PQPP。

关键词

引用

@article{arxiv.2406.04746,
  title  = {PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction},
  author = {Eduard Poesina and Adriana Valentina Costache and Adrian-Gabriel Chifu and Josiane Mothe and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2406.04746},
  year   = {2025}
}

备注

Accepted at CVPR 2025