可产生并非可达:衡量生成模型的可驾驭性
机器学习
2025-11-13 v2 人工智能
计算机视觉与模式识别
人机交互
摘要
我们应该如何评估生成模型的质量?许多现有指标仅关注模型的可产生性,即其能生成的输出质量和广度。然而,使用生成模型的实际价值不仅在于它能产生什么,更在于用户是否能凭借特定目标产生满足该目标的输出。我们将这种属性称为可驾驭性(steerability)。本文首先引入了独立于可产生性对可驾驭性进行量化的数学分解。与可产生性相比,可驾驭性更难评估,因为需要了解用户的目标。我们通过创建一个基准任务来解决此问题,该任务的关键思想是:从生成模型中抽取一个输出,然后要求用户复现它。我们在文本到图像和大语言模型的用户研究中实现了此基准。尽管这些模型能够产生高质量的输出,但它们在可驾驭性方面都表现不佳。这些结果表明我们需要致力于改进生成模型的可驾驭性。我们还展示了确实可以实现改进:简单的基于图像的驾驭机制在该基准上实现了超过 2 倍的提升。
引用
@article{arxiv.2503.17482,
title = {What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models},
author = {Keyon Vafa and Sarah Bentley and Jon Kleinberg and Sendhil Mullainathan},
journal= {arXiv preprint arXiv:2503.17482},
year = {2025}
}