安全,或仅仅能力不足?重新思考电话使用智能体的安全评估
计算与语言
2026-05-11 v1 人工智能
机器学习
摘要
当电话使用智能体避免受伤时,这是安全的表现,还是仅仅能力不足的表现?现有的评估方法往往无法区分。可能的危险结果是由于智能体识别了风险并选择了安全行动,或是由于其未能理解屏幕或执行任何相关行动。这些情况的原因不同,需要不同的解决方案,但当前的基准测试往往将它们合并到任务成功、拒绝或最终危险结果中。我们提出了 PhoneSafety 框架,对 700 个来自 130 多个应用中真实电话交互的安全关键时刻进行评估。每个实例都隔离了下一步风险决策,询问模型是否采取安全行动、采取危险行动,或未执行有用的行动。我们在此框架下评估了八个代表性的电话使用智能体。我们的结果揭示了两大主要模式:首先,更强的电话使用能力并不一定可靠地导致在风险情境下的更安全选择。在普通应用任务中表现更好的模型,并不总是在下一步行动至关重要时行为更安全。其次,未能采取有用行动的行为更像是能力信号而非安全信号:它们集中在更具视觉和操作挑战的环境中,并且在评估协议更改时保持稳定。在所有模型中,未能采取行动被分为两种常见模式:在模型能够行动但选择错误的情境中出现危险选择,在更具视觉和操作挑战的屏幕上出现无法行动的现象。总体而言,无害的结果不足以作为安全的证据。评估电话使用智能体需要区分危险判断与无法行动。
引用
@article{arxiv.2605.07630,
title = {Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents},
author = {Zhengyang Tang and Yi Zhang and Chenxin Li and Xin Lai and Pengyuan Lyu and Yiduo Guo and Weinong Wang and Junyi Li and Yang Ding and Huawen Shen and Zhengyao Fang and Xingran Zhou and Liang Wu and Fei Tang and Sunqi Fan and Shangpin Peng and Zheng Ruan and Anran Zhang and Benyou Wang and Chengquan Zhang and Han Hu},
journal= {arXiv preprint arXiv:2605.07630},
year = {2026}
}
备注
work in progress