中文

利用情境反事实实现信念校准

人工智能 2023-07-14 v1 机器学习

摘要

信念与价值正通过对齐过程(例如精心策划数据收集原则或正则化训练所用的损失函数)日益被纳入我们的人工智能系统。然而,元对齐问题在于这些人类信念是多样的且在群体间并未对齐;此外,即便在人类内部,每条信念的隐含强度也可能未得到良好校准,尤其在试图跨情境泛化时。具体而言,在高后悔情境中,我们观察到情境反事实与补救成本对于更新决策者的信念及其所持信念的强度尤为关键。因此,我们认为在对齐过程中纳入反事实是准确校准信念的关键。为此,我们首先将信念多样性划分为两类:主观性(群体内跨个体)与认知不确定性(个体内跨不同情境)。通过借助我们的认知不确定性概念,我们引入“信念校准循环”框架,利用多目标优化,以情境驱动的反事实推理更整体地校准这种信念多样性。我们实证地将框架应用于寻找跨不同情境泛化的聚类最优信念强度的帕累托前沿,并在信用决策的玩具数据集上展示了其有效性。

关键词

引用

@article{arxiv.2307.06513,
  title  = {Leveraging Contextual Counterfactuals Toward Belief Calibration},
  author = {Qiuyi and Zhang and Michael S. Lee and Sherol Chen},
  journal= {arXiv preprint arXiv:2307.06513},
  year   = {2023}
}

备注

ICML (International Conference on Machine Learning) Workshop on Counterfactuals in Minds and Machines, 2023