MERIT:多域高效 RAW 图像翻译
计算机视觉与模式识别
2026-03-24 v1 人工智能
摘要
不同相机传感器捕获的 RAW 图像由于光谱响应、噪声特性和色调行为的差异,呈现出显著的域间偏移,这 complicates 其在下游计算机视觉任务中的直接使用。先前方法通过为每个源-目标对训练域特定的 RAW-to-RAW 翻译器来解决此问题,但此类方法难以应用于涉及多种商业相机的实际场景。本文引入 MERIT,即首个针对多域 RAW 图像翻译的统一框架,利用单个模型即可实现跨任意相机域的翻译。为解决域间噪声差异问题,本文提出了传感器感知噪声建模损失,显式地将生成图像的信号相关噪声统计特性与目标域的噪声统计特性对齐。进一步地,我们通过条件多尺度大核注意力模块增强生成器,以实现更好的上下文和传感器感知特征建模。为便于标准化评估,我们引入 MDRAW,即首个针对多域 RAW 图像翻译的数据集,包含来自五种多样化相机传感器、覆盖广泛场景的配对及非配对 RAW 图像。广泛的实验表明,MERIT 在质量(提升约 5.56 dB)和可扩展性(训练迭代次数降低 80%)方面均优于先前模型。
引用
@article{arxiv.2603.20836,
title = {MERIT: Multi-domain Efficient RAW Image Translation},
author = {Wenjun Huang and Shenghao Fu and Yian Jin and Yang Ni and Ziteng Cui and Hanning Chen and Yirui He and Yezi Liu and Sanggeon Yun and SungHeon Jeong and Ryozo Masukawa and William Youngwoo Chung and Mohsen Imani},
journal= {arXiv preprint arXiv:2603.20836},
year = {2026}
}