MMIS:面向室内场景视觉生成与识别的多模态数据集
计算机视觉与模式识别
2024-07-09 v1
摘要
我们介绍MMIS——一个新型数据集,旨�推动室内场景视觉生成和识别。MMIS包含近16万张图片。数据集中的每张图片都附有对应的文本描述及其语音记录,为场景生成和识别提供丰富且多样化的信息源。MMIS涵盖广泛的室内空间,捕捉各种风格、布局和家具。构建该数据集时,我们采用严谨的方法,包括图片收集、文本描述生成以及语音标注。该数据集为图像生成、检索、描述和分类等多模态表征学习任务的研究做出了贡献。
引用
@article{arxiv.2407.05980,
title = {MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition},
author = {Hozaifa Kassab and Ahmed Mahmoud and Mohamed Bahaa and Ammar Mohamed and Ali Hamdi},
journal= {arXiv preprint arXiv:2407.05980},
year = {2024}
}