针对不公平服务条款检测的攻击:基于通用对抗触发器的案例研究
计算与语言
2022-11-29 v1
摘要
近期研究表明,自然语言处理技术可通过自动检测服务条款协议中的不公平条款来支持消费者保护。本工作证明,基于Transformer的服务条款分析系统易受对抗攻击。我们使用通用对抗触发器对不公平条款检测器进行攻击实验。实验表明,对文本的微小扰动即可显著降低检测性能。此外,为衡量触发器的可检测性,我们通过收集参与者的回答准确率和响应时间,进行了详细的人工评估研究。结果表明,触发器的自然程度仍是欺骗读者的关键。
引用
@article{arxiv.2211.15556,
title = {Attack on Unfair ToS Clause Detection: A Case Study using Universal Adversarial Triggers},
author = {Shanshan Xu and Irina Broda and Rashid Haddad and Marco Negrini and Matthias Grabmair},
journal= {arXiv preprint arXiv:2211.15556},
year = {2022}
}
备注
Accepted at NLLP@EMNLP2022