基于参考的多模态反事实生成的扩散 inpainting 方法
计算机视觉与模式识别
2025-08-01 v1 人工智能
摘要
安全关键型应用,如自动驾驶和医学图像分析,需要大量多模态数据进行严格测试。由于获取真实数据成本高昂且复杂,合成数据方法正日益受到关注,但其需要具备高度的真实性和可控性才能实用。本文引入两种用于自动驾驶和医学图像分析的合成数据生成方法,分别称为 MObI 和 AnydoorMed。MObI 是一种首创的多模态对象 inpainting 框架,利用扩散模型在感知模态之间(同时针对摄像头和激光雷达)生成逼真且可控的对象 inpainting。给定一个单张参考 RGB 图像,MObI 可在指定 3D 位置无缝插入对象,由边界框引导,同时保持语义一致性和多模态一致性。不同于仅依赖编辑掩码的传统 inpainting 方法,本方法采用 3D 边界框条件确保准确的空间定位和真实的比例尺。AnydoorMed 将这一范式扩展至医学影像领域,聚焦于乳腱图扫描的参考导引 inpainting。它利用基于扩散的模型对异常部位进行 inpainting,展现出惊人的细节保留能力,同时保持参考异常的结构完整性,实现与周围组织的语义融合。总体而言,这些方法表明自然图像中参考导引 inpainting 的基础模型可以轻松适用于多样化的感知模态,为下一代能够构建高度真实、可控且多模态反事实情景系统的路径已展开。
引用
@article{arxiv.2507.23058,
title = {Reference-Guided Diffusion Inpainting For Multimodal Counterfactual Generation},
author = {Alexandru Buburuzan},
journal= {arXiv preprint arXiv:2507.23058},
year = {2025}
}
备注
A dissertation submitted to The University of Manchester for the degree of Bachelor of Science in Artificial Intelligence