CHATEDIT:面向基于对话的多轮交互式人脸图像编辑
计算机视觉与模式识别
2023-10-17 v3
摘要
本文探索基于对话的交互式人脸图像编辑,并引入 ChatEdit 基准数据集以评估此情境下的图像编辑与对话能力。ChatEdit 构建自 CelebA-HQ 数据集,纳入了与用户对图像编辑请求相对应的标注多轮对话。该数据集具有挑战性,因其要求系统动态跟踪用户请求、编辑图像并生成恰当回复。相应地,我们提出三项基准任务:(i)用户编辑请求跟踪,(ii)图像编辑,以及(iii)回复生成。我们给出一种新颖的基线框架,其集成了用于跟踪用户请求与生成回复的对话模块,以及用于图像编辑的图像编辑模块。与以往方法不同,我们的框架直接从截至当前轮次的完整对话历史中跟踪用户编辑请求,并修改原始图像而非调整上一轮输出,从而降低误差累积并防止属性遗忘。在 ChatEdit 数据集上的大量实验凸显了我们框架相对先前模型的优越性能,同时也指出了进一步研究的潜在空间。我们将公开代码与数据,以促进复杂交互式人脸图像编辑的发展。
引用
@article{arxiv.2303.11108,
title = {CHATEDIT: Towards Multi-turn Interactive Facial Image Editing via Dialogue},
author = {Xing Cui and Zekun Li and Peipei Li and Yibo Hu and Hailin Shi and Zhaofeng He},
journal= {arXiv preprint arXiv:2303.11108},
year = {2023}
}
备注
Accepted to EMNLP 2023 (Main Conference)