复杂不可验证主题域中的自演化专业知识:对话作为隐式元强化学习
人工智能
2025-10-20 v1
摘要
所谓‘wicked problems’(恶性问题),即涉及复杂多维环境、不可验证的结果、差异化的影响以及缺乏单一客观正确答案的问题,困扰着人类历史。现代实例包括司法框架决策、环境污染解决、疫情韧性规划和粮食安全等。正在积极探索使用最先进的人工智能系统(尤其是大型语言模型代理)与人类协作解决此类问题。尽管大型语言模型的能力可以通过微调、精心设计的系统提示和外部工具的脚手架来提升,但大型语言模型缺乏在此类设置下通过经验发展专业知识的内生机制。本 work 通过 Dialectica 框架实现这一目标,该框架让代理在定义好的主题上进行结构化对话,辅以记忆、自省和受策略约束的上下文编辑。形式上,将对话视为隐式的元强化学习过程。经过对话训练的代理通过评估者对比评估所产生的响应来进行后置评估。跨两个模型架构(本地运行的 Qwen3:30b 和 OpenAI 的 o4-mini)的结果表明,启用基于反思的上下文编辑后,所得到的代理在 Elo 分数、归一化 Bradley-Terry-Davidson 能力以及 AlphaRank 质量方面均优于基线模型。从语句和反思日志中观察到的学习迹象定性地呈现,其中反思识别弱点并可靠地塑造后续陈述。定量与定性证据之间的一致性支持对话驱动的上下文演化作为开放不可验证域中有针对性专业知识放大的实用路径。
引用
@article{arxiv.2510.15772,
title = {Self-evolving expertise in complex non-verifiable subject domains: dialogue as implicit meta-RL},
author = {Richard M. Bailey},
journal= {arXiv preprint arXiv:2510.15772},
year = {2025}
}
备注
50 pages, 4 figures