CAISE:用于图像搜索与编辑的对话智能体
计算与语言
2022-02-25 v1 人工智能
计算机视觉与模式识别
摘要
随着用户表达欲望的增强,对图像编辑的需求日益增长。然而,对大多数用户而言,图像编辑工具并不易用,因为这些工具需要一定的照片特效专业知识且界面复杂。因此,用户可能需要有人协助编辑图像,但为每位用户配备专属人工助手无法规模化。为此,一个自动化的图像编辑助手系统是可取的。此外,用户希望获得更多图像来源以进行多样化的图像编辑工作,将图像搜索功能集成到编辑工具中可潜在满足该需求。因此,我们提出了一个自动化对话智能体用于图像搜索与编辑(CAISE)的数据集。据我们所知,这是首个提供对话式图像搜索与编辑标注的数据集,其中智能体与用户进行基于实体的对话,并根据用户请求帮助搜索和编辑图像。为构建此类系统,我们首先收集标注员两两之间的图像搜索与编辑对话。助手标注员配备定制化的图像搜索与编辑工具以应对用户标注员的请求。助手标注员使用该工具执行的功能被记录为可执行命令,使训练出的系统能应用于现实世界执行。我们还介绍了一种用于该任务的生成器-提取器基线模型,该模型能自适应选择下一个词元来源(即来自词表或来自文本/视觉上下文)以生成可执行命令。这作为一个强有力的起点,同时仍留有较大的人机性能差距以供未来有益工作。我们的代码与数据集公开于:https://github.com/hyounghk/CAISE
引用
@article{arxiv.2202.11847,
title = {CAISE: Conversational Agent for Image Search and Editing},
author = {Hyounghun Kim and Doo Soon Kim and Seunghyun Yoon and Franck Dernoncourt and Trung Bui and Mohit Bansal},
journal= {arXiv preprint arXiv:2202.11847},
year = {2022}
}
备注
AAAI 2022 (11 pages)