ContextBench:用于针对性潜在激活的上下文修改
人工智能
2026-03-09 v2 机器学习
机器学习
摘要
识别能触发特定行为或潜在特征的输入在语言模型的广泛应用场景中具有重要意义。我们探讨了一类能够生成特定潜在特征或诱发模型行为的、具备目标性且语言流畅输入的方法。我们将这种方法正式化为上下文修改,并提出ContextBench——一个评估核心方法能力及潜在安全应用场景的基准测试。我们的评估框架衡量elicitation strength(潜在特征或行为的激活程度)和语言流畅度,突显当前状态-of-the-art 方法在平衡这两个目标方面的困难。我们通过引入 LLM 辅助和扩散模型填充,增强了进化式提示优化(EPO),并表明这些变体在平衡elicitation effectiveness 与流畅度方面实现了最先进的性能。
引用
@article{arxiv.2506.15735,
title = {ContextBench: Modifying Contexts for Targeted Latent Activation},
author = {Robert Graham and Edward Stevinson and Leo Richter and Alexander Chia and Joseph Miller and Joseph Isaac Bloom},
journal= {arXiv preprint arXiv:2506.15735},
year = {2026}
}
备注
Published at ICLR 2026