生成实体相互作用的精细细节
计算机视觉与模式识别
2026-03-05 v2 计算与语言
机器学习
摘要
最近的文本到图像模型在从指令生成高质量的对象中心图像方面表现出色。然而,图像也应包含对象之间丰富的相互作用,而现有模型在这方面往往不足,这可能是由于受限的训练数据和覆盖稀有相互作用的基准不足所致。本文探索了将多模态大型语言模型(MLLM)应用于基准和增强相互作用丰富图像生成的新颖应用。我们引入了 \data,这是一个以交互作用为焦点的 数据集,包含 1000 个由 LLM 生成的细粒度提示,用于图像生成,覆盖 (1) 功能和基于动作的相互作用、(2) 多主体相互作用、(3) 组合空间关系。为解决相互作用丰富的生成挑战,我们提出了一种分解增强的精炼程序。我们的 \model 方法利用 LLM 将相互作用分解为更细粒度的概念,使用 MLLM 对生成的图像进行批评,并通过部分扩散去噪过程进行有针对性的精炼。自动和人类评估均显示出显著的图像质量提升,展示了增强推理策略的潜力。
引用
@article{arxiv.2504.08714,
title = {Generating Fine Details of Entity Interactions},
author = {Xinyi Gu and Jiayuan Mao},
journal= {arXiv preprint arXiv:2504.08714},
year = {2026}
}
备注
EMNLP 2025. Project Page: https://detailscribe.github.io/