SPARTA: 基于文本自编码器潜在空间中的黑箱对抗改写评估推理分割鲁棒性
计算与语言
2025-10-29 v1 计算机视觉与模式识别
摘要
多模态大型语言模型 (MLLM) 在基于文本查询生成分割掩码的推理分割等视觉语言任务中展现了惊人的能力。虽然先前工作主要关注扰动图像输入,但在现实应用中用户以各种方式表达相同意图的语义等价文本改写——尤其关键——仍未得到充分探索。为填补这一空白,我们引入一种新颖的对抗改写任务:生成在保持原始查询语义的同时削弱分割性能的语法正确改写。为评估对抗改写质量,我们发展了一套全面的自动评估协议,并通过人类研究进行验证。进一步,我们引入 SPARTA——一种在文本自编码器低维语义潜在空间中进行的黑箱句子级优化方法,借助强化学习引导。SPARTA 在 ReasonSeg 和 LLMSeg-40k 数据集上实现了显著更高的成功率,净多出约 2 倍。我们使用 SPARTA 和竞争基线评估先进推理分割模型的鲁棒性。我们揭示了即便在严格的语义和语法约束下,这些模型仍对对抗改写保持脆弱。所有代码和数据将在接受后公开发布。
引用
@article{arxiv.2510.24446,
title = {SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space},
author = {Viktoriia Zinkovich and Anton Antonov and Andrei Spiridonov and Denis Shepelev and Andrey Moskalenko and Daria Pugacheva and Elena Tutubalina and Andrey Kuznetsov and Vlad Shakhuro},
journal= {arXiv preprint arXiv:2510.24446},
year = {2025}
}