当情境推断失败:交互式指令遵循中的可取消性
计算与语言
2026-03-23 v1
摘要
我们研究了在构建积木块的协作任务中,将字面解释与情境推断分离的能力。在该任务中,建造者必须通过情境推断来解决不完整的指令。基于现有的两种说话人心理语言学范例——对话作主语的说话人与仅可靠地说话人的说话人——我们引入Build What I Mean(BWIM),用于情境意义构建的交互式基准。在BWIM中,模型必须通过执行情境推断或以小的通信成本请求澄清来解决歧义。评估Several state-of-the-art LLMs,我们发现判断与行动之间的dissociation:虽然模型在显式置信度评分中检测到说话人不可靠,但它们未利用这一信息来指导高效的澄清行为。相反,我们观察到亚optimal策略,如对合作者不敏感的过度澄清和在不确定性下的抗问题猜测。
引用
@article{arxiv.2603.19997,
title = {When Contextual Inference Fails: Cancelability in Interactive Instruction Following},
author = {Natalia Bila and Kata Naszádi and Alexandra Mayn and Christof Monz},
journal= {arXiv preprint arXiv:2603.19997},
year = {2026}
}