诚实AI:开发与治理不说谎的AI
计算机与社会
2021-10-14 v1 人工智能
计算与语言
摘要
在许多情境中,说谎——使用言语虚假陈述进行欺骗——是有害的。虽然说谎传统上是人类的行为,但能作出复杂言语陈述的AI系统正变得日益普遍。这引发了我们应如何限制AI“谎言”(即被主动选中的虚假陈述)所造成危害的问题。人类的诚实受社会规范和法律(反诽谤、伪证和欺诈)约束。AI与人类之间的差异提供了一个机会,为AI制定更精确的诚实标准,并让这些标准随时间提升。这可为公共认知与经济带来显著益处,并缓解最坏情形AI未来的风险。建立AI诚实的规范或法律将需要大量工作以:(1)确定清晰的诚实标准;(2)创建能判定对这些标准遵守情况的机构;以及(3)开发稳健诚实的AI系统。我们在这些领域的初步提议包括:(1)避免“疏忽性虚假陈述”的标准(比谎言更易评估的泛化);(2)在现实部署前后评估AI系统的机构;以及(3)通过精选数据集与人类交互显式训练AI系统保持诚实。一个令人担忧的可能性是,最终诚实标准的评估机制可能被政治利益俘获,导致有害的审查与宣传。避免这一点可能需要审慎关注。并且由于AI言语行为规模在未来数十年可能急剧增长,早期的诚实标准因其所设立的先例可能尤为重要。
引用
@article{arxiv.2110.06674,
title = {Truthful AI: Developing and governing AI that does not lie},
author = {Owain Evans and Owen Cotton-Barratt and Lukas Finnveden and Adam Bales and Avital Balwit and Peter Wills and Luca Righetti and William Saunders},
journal= {arXiv preprint arXiv:2110.06674},
year = {2021}
}