MixSA:基于混合自注意力的无训练参考基准素描提取
计算机视觉与模式识别
2025-01-03 v1
摘要
当前的素描提取方法要么需要大量训练,要么无法捕捉到广泛的艺术风格,这限制了其实际应用性和通用性。我们引入 Mixture-of-Self-Attention (MixSA),一种利用强扩散先验实现素描感知的无训练素描提取方法。 MixSA 的核心采用混合自注意力技术,通过用参考素描的键和值替换自注意力层的方式,实现了对初始轮廓图像中笔触元素的无缝集成,从而实现对纹理密度的精确控制,并支持风格之间的插值以创建新颖且未曾出现的风格。通过将笔触风格与彩色图像的纹理和轮廓对齐(特别是在处理局部纹理的晚期解码器层中),MixSA 解决了常见的颜色平均问题,通过调整初始轮廓来实现。评估结果表明,MixSA 在素描质量、灵活性和适用性方面均表现出优异性能。该方法不仅克服了现有方法的局限性,还使用户能够生成多样化且高保真度的素描,更准确地反映广泛的艺术表达。
引用
@article{arxiv.2501.00816,
title = {MixSA: Training-free Reference-based Sketch Extraction via Mixture-of-Self-Attention},
author = {Rui Yang and Xiaojun Wu and Shengfeng He},
journal= {arXiv preprint arXiv:2501.00816},
year = {2025}
}
备注
25 pages, 25 figures; Accepted by IEEE IEEE Transactions on Visualization and Computer Graphics, 2024 (TVCG)