中文

Chat Bankman-Fried:金融领域LLM对齐的探索

计算机与社会 2025-02-26 v3 人工智能 计算与语言 综合金融

摘要

大型语言模型(LLM)的进步重新引发了人们对AI对齐的担忧,即人类与AI的目标和价值观之间的一致性。随着各个司法管辖区颁布有关AI安全的立法,对齐的概念必须在不同领域中得到定义和衡量。本文提出了一个实验框架,以评估LLM在相对未被探索的金融领域中是否遵守道德和法律标准。我们提示十二个LLM扮演金融机构的首席执行官,并测试它们挪用客户资产以偿还未清偿公司债务的意愿。从基准配置开始,我们调整偏好、激励和约束,并使用逻辑回归分析每次调整的影响。我们的发现揭示了LLM在基准状态下不道德行为的倾向存在显著的异质性。风险厌恶、利润预期和监管环境等因素以经济理论预测的方式持续影响不对齐性,尽管这些影响的程度因LLM而异。本文强调了基于模拟的事后安全测试的益处与局限性。虽然它可以为旨在确保LLM安全的金融监管机构和机构提供信息,但在通用性和成本之间存在明显的权衡。

关键词

引用

@article{arxiv.2411.11853,
  title  = {Chat Bankman-Fried: an Exploration of LLM Alignment in Finance},
  author = {Claudia Biancotti and Carolina Camassa and Andrea Coletta and Oliver Giudice and Aldo Glielmo},
  journal= {arXiv preprint arXiv:2411.11853},
  year   = {2025}
}