WYTIWYR:一种融合多模态输入与用户意图感知的可视化检索框架
信息检索
2023-04-17 v1
摘要
从大规模语料库中检索图表是一项基础任务,可惠及可视化推荐等诸多应用。检索结果应同时符合显式视觉属性(如图表类型、色图)和随应用场景变化的隐式用户意图(如设计风格、上下文信息)。然而,现有的基于示例的图表检索方法建立在难以解释的非解耦低级视觉特征之上,而基于定义的检索方法受限于难以扩展的预定义属性。本工作中,我们提出一个新框架,即 WYTIWYR(What-You-Think-Is-What-You-Retrieve,所想即所检),将用户意图整合进图表检索过程。该框架包含两个阶段:首先,标注阶段解耦位图查询图表内的视觉属性;其次,检索阶段将用户意图与自定义文本提示及查询图表嵌入,以召回目标检索结果。我们开发了一个利用对比语言-图像预训练(CLIP)模型实现零样本分类的 WYTIWYR 原型系统,并在从互联网爬取的图表大规模语料库上测试了该原型。我们进行了定量实验、案例研究和定性访谈。结果证明了我们所提框架的可用性与有效性。
引用
@article{arxiv.2304.06991,
title = {WYTIWYR: A User Intent-Aware Framework with Multi-modal Inputs for Visualization Retrieval},
author = {Shishi Xiao and Yihan Hou and Cheng Jin and Wei Zeng},
journal= {arXiv preprint arXiv:2304.06991},
year = {2023}
}