中文

ICL 优化的脆弱性

人工智能 2025-10-02 v1

摘要

已知 ICL 指南能提升特定任务的性能,但其对跨领域认知能力的影响仍未被探索。本研究使用 GPT-OSS:20b 模型的六个变体:一个基线模型和五个 ICL 配置(简单、思维链、随机、附加文本和符号语言),考察了 ICL 指南如何影响不同知识领域的推理。对模型进行了 840 项测试,涵盖常识问题、逻辑谜题和数学奥林匹克问题。统计分析(ANOVA)显示,各 ICL 变体之间存在显著的行为改变(p 小于 0.001),证明了被称为“优化的脆弱性”的现象。ICL 模型在常识任务上达到了 91%-99% 的准确率,而在复杂推理问题上的表现下降,与基线模型 43% 的准确率相比,在谜题上的准确率降至 10-43%。值得注意的是,在奥林匹克问题上未出现显著差异(p=0.2173),表明复杂的数学推理不受 ICL 优化的影响。这些发现表明,ICL 指南在效率和推理灵活性之间造成了系统性权衡,对 LLM 部署和 AI 安全具有重要意义。

关键词

引用

@article{arxiv.2510.00300,
  title  = {ICL Optimized Fragility},
  author = {Serena Gomez Wannaz},
  journal= {arXiv preprint arXiv:2510.00300},
  year   = {2025}
}