SemEval-2025 Task 4 中的 Atyaephyra:低秩负偏好优化
计算与语言
2025-05-09 v2 人工智能
机器学习
摘要
我们提交了一个条目给SemEval 2025共享任务,该任务旨在从LLM中擦除敏感内容。我们的方法采用低秩适应性负偏好优化。我们展示,可以利用这一组合有效地计算额外的正则化项,这有助于擦除稳定性。我们方法的结果显著超过了共享任务的基线。
引用
@article{arxiv.2503.13690,
title = {Atyaephyra at SemEval-2025 Task 4: Low-Rank Negative Preference Optimization},
author = {Jan Bronec and Jindřich Helcl},
journal= {arXiv preprint arXiv:2503.13690},
year = {2025}
}
备注
8 pages, 3 figures, accepted to SemEval workshop proceedings at ACL 2025