通过测试时嵌入调整缓解生成式个人化中的语义崩溃
机器学习
2026-02-26 v3 图形学
摘要
本文探讨了生成式个人化中语义崩溃问题,这一受关注不足的议题,指出所学习的视觉概念()会逐渐偏离其原始文本含义,并主导多概念输入提示中的其他概念。该问题不仅会使复杂输入提示(如"a photo of wearing glasses and playing guitar")简化为更简洁、上下文较少的形式(如"a photo of "),还会导致输出图像未能捕捉预期概念。我们识别出根本原因是无约束的优化,使得学习到的嵌入 在嵌入空间中的方向和大小都可以任意漂移。为此,我们提出一种简单而有效的训练-free方法,通过调整预训练嵌入在推理时的时间的大小和方向,从而有效缓解了语义崩溃问题。该方法适用于不同的方法,显示出在多样化用例中对文本-图像对齐具有显著的改进。我们的编码已匿名发布于 https://github.com/tuananhbui89/Embedding-Adjustment
引用
@article{arxiv.2506.22685,
title = {Mitigating Semantic Collapse in Generative Personalization with Test-Time Embedding Adjustment},
author = {Anh Bui and Trang Vu and Trung Le and Junae Kim and Tamas Abraham and Rollin Omari and Amar Kaur and Dinh Phung},
journal= {arXiv preprint arXiv:2506.22685},
year = {2026}
}