长度真的会成为负债吗?基于 BoolQ 的多轮 LLM 对话评估
计算与语言
2026-01-26 v1
摘要
当前 LLM 基准测试主导采用单次提示评估,然而这种方法未能捕捉到实际应用中才会产生实质性风险的对话动态。本研究考察了对话长度是否影响模型响应的真实性,通过在不同长度和结构化条件下对 LLM 在 BoolQ 数据集上的表现进行评估。我们在三个不同的 LLM 上发现,单轮测试下难以暴露的模型特定脆弱性在多轮对话环境下得以显现。我们观察到的长度相关效应和结构化相关效应揭示了静态评估的根本局限,因为仅在多轮对话情境中才能捕捉到与实际部署相关的脆弱性风险。
引用
@article{arxiv.2601.16508,
title = {Is Length Really A Liability? An Evaluation of Multi-turn LLM Conversations using BoolQ},
author = {Karl Neergaard and Le Qiu and Emmanuele Chersoni},
journal= {arXiv preprint arXiv:2601.16508},
year = {2026}
}
备注
4 pages plus 6 pages of bibliography and appendix