TDRI:用于交互式图像生成的双相对话细化与协同适应
计算机视觉与模式识别
2025-07-09 v3
摘要
虽然文本到图像生成技术取得了显著进展,但在处理模糊提示和对齐输出与用户意图方面仍面临挑战。我们提出的框架TDRI(Two-Phase Dialogue Refinement and Co-Adaptation)通过迭代用户交互来增强图像生成。它包含两个阶段:初始生成阶段基于用户提示创建基础图像,以及交互式细化阶段通过三个关键模块整合用户反馈。对话到提示(Dialogue-to-Prompt, D2P)模块确保用户反馈有效转化为可操作的提示,从而提高用户意图与模型输入之间的对齐度。通过对比生成输出与用户期望,反馈-反思(Feedback-Reflection, FR)模块识别差异并促进改进。为确保持续的高质量结果,自适应优化(Adaptive Optimization, AO)模块通过平衡用户偏好并保持提示保真度来微调生成过程。实验结果表明,TDRI在现有方法中表现突出,人类偏好达到33.6%,相较于GPT-4增强的6.2%,且实现最高的CLIP和BLIP对齐分数(分别为0.338和0.336)。在迭代反馈任务中,用户满意度在8轮后达到88%,且在6轮之后呈递减趋势。此外,TDRI被发现可减少迭代次数并提升时尚产品创建中的个性化程度。TDRI在广泛的创意和工业领域具有强大的应用潜力,因为它简化了创作过程并提高了与用户偏好的一致性。
引用
@article{arxiv.2503.17669,
title = {TDRI: Two-Phase Dialogue Refinement and Co-Adaptation for Interactive Image Generation},
author = {Yuheng Feng and Jianhui Wang and Kun Li and Sida Li and Tianyu Shi and Haoyue Han and Miao Zhang and Xueqian Wang},
journal= {arXiv preprint arXiv:2503.17669},
year = {2025}
}