中文

更精细的个人化排名:细粒度检索检视身份保持

密码学与安全 2025-12-24 v2 人工智能 机器学习

摘要

面向个性化生成模型的兴起引发了一个核心问题:我们应如何评估身份保持?给定参考图像(例如宠物的一张照片),我们期望生成的图像保留与受体身份相关的精确细节。然而,当前的生成评估指标强调参考输出之间的整体语义相似性,忽略了这些细粒度判别性细节。我们引入更精细的个人化排名(Finer-Personalization Rank),这是一种专为身份保持设计的评估协议。与成对相似度不同,Finer-Personalization Rank采用排序视角:将每个生成图像视为查询对象,针对由带身份标签的视觉相似实图像组成的画廊进行检索。检索指标(例如平均精度)用于衡量性能,其中更高的分数表明身份特定细节(例如独特的斑点)被保留。我们在CUB、Stanford Cars和动物Re-ID基准上评估了身份在多个细粒度层次上的保持——从细粒度类别(例如鸟类种类、汽车型号)到单个实例(例如重识别)。结果表明,Finer-Personalization Rank比仅基于语义的指标更忠实地反映了身份保留,揭示了几类流行个性化方法中存在的显著身份漂移。这些结果将基于画廊的协议定位为一种原则且实用的个性化生成评估方法。

关键词

引用

@article{arxiv.2512.19025,
  title  = {The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation},
  author = {Hengrui Jia and Taoran Li and Jonas Guan and Varun Chandrasekaran},
  journal= {arXiv preprint arXiv:2512.19025},
  year   = {2025}
}