中文

GenTune:面向可追溯提示词以提升环境设计中图像精修的可控性

人机交互 2025-09-03 v1 人工智能

摘要

娱乐行业的环境设计师为游戏、电影和电视创作富有想象力的 2D 和 3D 场景,这既需要对特定细节的精细控制,也需要保持全局一致性。设计师们越来越多地将生成式 AI 集成到他们的工作流程中,通常依赖大语言模型(LLM)来扩展用户提示词以进行文本到图像的生成,然后迭代地精炼这些提示词并应用图像修复。然而,我们对 10 位设计师进行的形成性研究揭示了两大关键挑战:(1)冗长的 LLM 生成提示词使得理解和分离出需要为特定视觉元素修改的关键词变得困难;(2)虽然图像修复支持局部编辑,但它可能在全局一致性和正确性方面遇到困难。基于这些见解,我们提出了 GenTune,这是一种通过阐明 AI 生成的提示词如何映射到图像内容来增强人机协作的方法。我们的 GenTune 系统允许设计师选择生成图像中的任何元素,将其追溯到相应的提示词标签,并修改这些标签以引导精确且全局一致的图像精修。在一项对 20 位设计师的总结性研究中,与当前实践相比,GenTune 显著提升了提示词-图像理解、精修质量和效率以及整体满意度(所有 p<.01p < .01)。一项对两家工作室的后续实地研究进一步证明了其在真实场景中的有效性。

关键词

引用

@article{arxiv.2508.15227,
  title  = {GenTune: Toward Traceable Prompts to Improve Controllability of Image Refinement in Environment Design},
  author = {Wen-Fan Wang and Ting-Ying Lee and Chien-Ting Lu and Che-Wei Hsu and Nil Ponsa Campanyà and Yu Chen and Mike Y. Chen and Bing-Yu Chen},
  journal= {arXiv preprint arXiv:2508.15227},
  year   = {2025}
}

备注

Accepted ACM Symposium on User Interface Software and Technology (UIST '25)