中文

不完美的必要性:通过模拟认知局限性来逆转模型崩溃

人工智能 2025-12-10 v3 计算与语言 计算机与社会 机器学习 交易与市场微观结构

摘要

尽管合成数据广泛被推广为解决方案,但其主流生产范式——即优化统计光滑性——系统性地消除了特征人类文本所特有的长尾、认知导向的不规则性。长期使用此类统计上最优但认知上被削弱的数据进行训练会加速模型崩溃。本文提出范式转变:不追求模仿数据表面属性,而是模拟产生人类文本的认知过程。我们引入了提示驱动认知计算框架(PMCSF),其核心包含认知状态解码器(CSD),用于将非结构化文本逆向工程为结构化认知向量;以及认知文本编码器(CTE),通过数学定义的认知扰动算子将这些状态重新物化为富含人类典型不完美之处的文本。该框架通过两个阶段的客观评估管线进行验证。首先,在认知编解码器验证中,CTE生成的文本与人类文本的 Jensen-Shannon 发散率为 0.0614(相较于标准大语言模型输出的 0.4431),通过双盲专业媒体审阅,并在异构模型间实现认知轮廓对齐,实现类相关系数 ICC > 0.9。其次,在功能性收益评估中,A 股市场的等价应力测试表明,纳入CTE生成数据的策略在 2015 年熊市期间最大回撤降低 47.4%,实现 8.6% 的防御性阿尔法收益,超出交易成本 33 倍。我们的发现表明,建模人类认知局限——而非复制数据表面特征——可实现具有真实功能性收益的合成数据,为解决AI数据崩溃危机提供了可行的技术路径。

关键词

引用

@article{arxiv.2512.01354,
  title  = {The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness},
  author = {Zhongjie Jiang},
  journal= {arXiv preprint arXiv:2512.01354},
  year   = {2025}
}

备注

60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility