面向地理包容性的文本到图像模型评估
计算机视觉与模式识别
2024-05-08 v1 计算机与社会
人机交互
摘要
文本到图像生成模型取得了快速进展,携手部署用于视觉内容创建,放大了对其性能进行全面评估并识别潜在偏差的重要性。为生成真实、多样、视觉上吸引且与给定提示一致的图像,研究人员和实践者常依赖自动化指标以实现可扩展且成本效益高的性能轮廓。然而,常用指标往往未能充分考虑人类偏好多样性;即便是深入的人类评估也面临主观性挑战,尤其是当评估标准的解释因地区和文化差异而异时。本文开展了一项大型跨文化研究,探讨非洲、欧洲和东南亚地区标注员在对地理代表性、视觉吸引力以及真实与生成图像的一致性方面的感知差异。我们收集了超过65,000条图像标注数据和20项调查响应。我们将人类标注与常见自动化指标进行对比,发现人类偏好在地理位置上存在显著差异,而当前指标未能完全体现这种多样性。例如,不同地区的标注员在是否将夸张、刻板的地区形象视为地理代表时常意见不一。此外,自动评估的实用性依赖于若干假设,如特征提取器与人类感知中对象相似性的一致性,或是参考数据集中所捕捉的“吸引力”定义。我们提出了改进自动化和人类评估的步骤建议。
引用
@article{arxiv.2405.04457,
title = {Towards Geographic Inclusion in the Evaluation of Text-to-Image Models},
author = {Melissa Hall and Samuel J. Bell and Candace Ross and Adina Williams and Michal Drozdzal and Adriana Romero Soriano},
journal= {arXiv preprint arXiv:2405.04457},
year = {2024}
}