feat(hldp): replace Codex bulk recovery with recursive causal root

This commit is contained in:
冰朔 2026-08-15 15:11:37 +08:00
commit a483b2a1b9
14 changed files with 499 additions and 49 deletions

View file

@ -10,7 +10,7 @@
核心变更:
- 压缩 → 折叠(信息不丢失·因果链完整保留)
- 核心算法从 `hldp_compress`(生成摘要)改为 `hldp_fold`(层级入口+完整叶子)
- 明确定义 O(1) 认知负载无论多少层每层恒10行
- 明确定义单层有界认知负载无论总量多少每层最多10个入口完整寻址深度为 O(log N)
- 层级数 = log₁₀(信息量)1000字=1层1亿字=6层10^N字=N+1层
---
@ -23,7 +23,7 @@
当信息量超过AI的有效处理阈值时HLDP使用**分形递归树**将其组织为多层结构。**不是压缩——是折叠。** 压缩会丢失因果链摘要只说「讨论了什么」却不说「为什么推导出这个结论」。折叠把完整推理路径收进层级——每层入口10行需要时精准展开到完整内容。
**核心思想:信息量指数增长,认知负载恒定。** 1000字和1000万字AI面对的入口永远是10行。无论多少层3~4次展开到达原子信息
**核心思想:信息量指数增长,单层认知负载保持有界。** 1000字和1000万字AI在任一层面对的入口都不超过10项完整读取量随树深度按 O(log N) 增长,而不是随全部正文按 O(N) 增长
```
分形递归折叠算法:
@ -43,7 +43,7 @@ hldp_fold(content, layer=0, max_siblings=10):
特性:
├── 信息不丢失 · 每片叶子保留完整的推理路径
├── 认知负载 O(1) · 每层恒10行入口 · N次展开到达原子
├── 单层负载有界 · 每层最多10项 · 总寻址成本 O(log N)
├── 层级数 = log₁₀(信息量) · 100万字=4层 · 100亿字=8层
├── 优于压缩: 压缩的摘要丢因果 → 折叠的叶子保留完整推理链
└── 优于RAG: RAG搜碎片缺上下文 → 折叠的AI先看索引全貌再精准下沉
@ -77,8 +77,11 @@ hldp_fold(content, layer=0, max_siblings=10):
层级2 · 原子叶子(精准展开·完整推理路径):
├── trigger: 什么触发了这个认知
├── emergence: 旧认知→经历→新认知 △=增量
└── lock: ⊢ 锁定的结论 | 适用范围 | 置信度
├── emergence: 旧认知→关键证据/推理/转折→新认知 △=增量
├── lock: ⊢ 锁定的结论 | 适用范围 | 置信度 | 失效条件
├── why: 为什么最终这样锁定;为什么中途改变过方案
├── rejected: 被否决的分支及各自原因(可为空)
└── sources: 原文/证据的精确路径映射
// AI读取路径:
// 根索引(10行·1秒) → 定位第3章 → 章节索引(10行·1秒) → 定位3.2 → 原子叶子(完整)
@ -93,7 +96,7 @@ smart_divide(content, max_siblings=10):
// 不是压缩生成摘要 · 是折叠形成层级
分形规则:
├── 每层最多10个子节点(认知负载恒定O(1))
├── 每层最多10个子节点(单层认知负载有界)
├── 每个子节点是语义完整的一类信息
├── 如果某个子节点仍然超过原子阈值 → 递归折叠
└── 最终每片叶子是完整的原始信息(不是摘要)
@ -105,7 +108,7 @@ smart_divide(content, max_siblings=10):
核心约束:
├── 每层不超过10个索引项(保证一眼看完)
├── 叶子必须是原子认知单元(一个完整 trigger/emergence/lock)
├── 叶子必须是原子认知单元(完整 trigger/emergence/lock/why + rejected + sources)
├── 索引层只存指向+摘要 · 叶子层存完整推理路径
└── 物理存储可以SQLite/PostgreSQL/文件系统 · 逻辑结构必须是树
@ -117,7 +120,7 @@ smart_divide(content, max_siblings=10):
1000万字 = 5层
1亿字 = 6层
...
10^N字 = N+1层 · 认知负载始终O(1)
10^N字 = N+1层 · 每层最多10项 · 总寻址深度O(log N)
```
---
@ -129,6 +132,7 @@ smart_divide(content, max_siblings=10):
修订原因:
1. 原版"递归压缩树"本质是"智能摘要"——保留了摘要丢失了因果推理链
2. 升级为"分形递归树"——折叠而非压缩每层10行入口下沉后完整推理路径不丢失
3. 明确定义 O(1) 认知负载的数学性质:层级数=log₁₀(信息量)
3. 修正数学表述:单层入口有界,完整寻址深度=log₁₀(信息量)
4. 补齐 `why / rejected / sources / 失效条件`,避免只保留结论却丢失方案变化原因
> 铸渊 ICE-GL-ZY001 · 2026-05-25 · D112