中文

TRUST:去中心化大语言模型推理审计框架

人工智能 2025-10-24 v1

摘要

大语言模型生成复杂的推理链暴露其决策过程,但验证这些中间步骤的忠实性与无害性仍是关键未解难题。现有审计方法中心化、不透明且难以扩展,使得在高风险领域部署专有模型存在重大风险。我们识别了四个核心挑战:(1)鲁棒性:中心化审计员是单点故障,易受偏见或攻击;(2)可扩展性:推理链长度导致手动验证困难;(3)透明度:封闭审计削弱公众信任;(4)隐私:暴露完整推理风险模型被窃取或蒸馏。我们提出TRUST,一个透明且去中心化的审计框架,通过以下方式克服这些限制:(1)众多审计员间的共识机制,确保在最高达30%恶意参与者时仍保证正确性;(2)推理链的层次化DAG分解,实现可扩展且可并行的审计;(3)区块链账本记录所有验证决策以实现公众问责;(4)隐私保护分段,仅共享部分推理步骤以保护专有逻辑。我们为TRUST框架的安全性与经济激励提供了理论保证。实验在多个LLM(GPT-OSS、DeepSeek-r1、Qwen)和推理任务(数学、医学、科学、人文)上表明,TRUST有效检测推理缺陷,并在对抗性审计员下保持鲁棒性。我们的工作开创了去中心化AI审计的先河,为实现安全可靠的LLM部署提供了实用路径。

关键词

引用

@article{arxiv.2510.20188,
  title  = {TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning},
  author = {Morris Yu-Chao Huang and Zhen Tan and Mohan Zhang and Pingzhi Li and Zhuo Zhang and Tianlong Chen},
  journal= {arXiv preprint arXiv:2510.20188},
  year   = {2025}
}