超越局部 vs. 外部:面向可信知识获取的博弈论框架
计算与语言
2026-04-28 v1
摘要
云托管的大型语言模型(LLM)提供了卓越的推理能力和动态知识,但向这些外部服务提交原始查询风险暴露敏感用户意图。相比之下,完全依赖可信本地模型可保留隐私,但常常因参数规模和知识有限而牺牲答案质量。为解决这一困境,我们提出了博弈论可信知识获取(GTKA)框架,将知识效用与隐私之间的权衡形式化为战略博弈。GTKA 由三个组件组成:(i) 具备隐私意识的子查询生成器,将敏感意图分解为通用、低风险片段;(ii) 对抗性重构攻击者尝试从这些片段推断原始查询,提供自适应泄露信号;(iii) 可信本地集成器在安全边界内合成外部响应。通过交替式对抗方式训练生成器和攻击者,GTKA 可优化子查询生成策略,以在获取知识的准确性方面最大化,同时最小化对原始敏感意图的可重构性。为验证我们的ethods,我们构建了面向医学和法律领域的两个敏感域基准。大量实验表明,GTKA 在保持高保真度答案质量的同时,显著优于当前最先进的基线方法,显著降低了意图泄露。
引用
@article{arxiv.2604.23413,
title = {Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge Acquisition},
author = {Rujing Yao and Yufei Shi and Yang Wu and Ang Li and Zhuoren Jiang and XiaoFeng Wang and Haixu Tang and Xiaozhong Liu},
journal= {arXiv preprint arXiv:2604.23413},
year = {2026}
}