持续学习¶
OLAV 跑得越久,就越擅长你的运维——而且不用你盯着。它靠三个互补的学习层实现这一点:它们以不同的速度运转,并被治理成彼此强化而非互相打架。本页是总览;每一层都有各自的深入页面。
特性声明
| ID | 声明 | 状态 |
|---|---|---|
| C-CL-MEMORY | 记忆层从使用中持续学习、无需微调(自我改进循环) | ✅ |
| C-CL-HYGIENE | 陈旧的失败教训会被降级/取代/纠正,修好后不再拦截 | ✅ |
| C-CL-WEIGHTS | 经验可导出为干净数据集并巩固进模型权重,由基准门把关 | ✅ 机制 |
| C-CL-HARNESS | harness 遥测驱动"基准门把关 + 人工批准"的配置调优 | ✅ 机制 |
| C-CL-GOVERNANCE | 三层有显式的分层、优先级、变更权限契约(ADR-0016) | ✅ |
核心思想:快速建议、慢速习惯、稳定宪法¶
一个有用的心智模型是互补记忆系统:一个快速情景记忆、一套缓变的技能、一本固定的规则手册。OLAV 与之对应:
| 层 | 类比 | 改变什么 | 多快 | 微调? |
|---|---|---|---|---|
| 记忆 | 工作建议 / 海马体 | 注入的教训、指南、查询模式 | 持续 | 否(非参数) |
| 权重 | 习惯 / 本能 | 模型本身 | 周期性 | 是(可选) |
| harness | 宪法 | 上下文预算、top_k、上限、启用哪些机制 |
很少 | 否(配置) |
每一层都以同样的形态改进——反思 → 提案 → 门把关 → 应用——但改动它的门槛逐层加严:记忆层廉价地自我编辑,权重需要基准门,harness 需要基准门加上人。没有任何一层能重写自己的宪法。
第 1 层 — 记忆(快、非参数)¶
自我改进循环捕获运行中发生的事,把反复出现的模式蒸馏成可复用的教训,并在下一次相似任务时把相关教训注入提示(AutoRecall)。同样的模型、同样的代码——用了一周的部署会明显比全新安装更聪明,因为它的记忆更丰富。无需训练,无需运维介入。
学习也意味着忘掉该忘的。 从瞬态失败学来的教训("服务 X 连不上")在 X 修好后不该继续拦截任务。OLAV 的记忆卫生自动处理这点:
- 瞬态失败降级——环境类失败(连接被拒、权限不足、服务未运行)以短租约 + 封顶置信度存储,而非 30 天的持久规则。
- 取代(supersession)——若某失败所指责的工具此后已成功,则该陈旧教训在召回时被抑制,修好的服务立即不再拦截。
- 纠正感知——"X 又能用了"被识别为对"X 失败"的纠正,写入并允许退休旧教训,而非当作近似重复丢弃。
存储与分类见记忆架构。
第 2 层 — 权重(慢、参数式巩固)¶
记忆层是"快权重"。周期性地,它积累的持久教训可以被巩固进模型的真实权重——慢权重交接:
- 导出——成功轨迹、偏好对、清洗后的记忆成为训练数据。瞬态/被取代/低置信噪声被滤除;密钥被脱敏;导出加密且访问由 OLAV 控制。
- 微调——LoRA adapter 教模型 OLAV 的工具调用与长链习惯。分两档交付:面向社区地板的开源微调模型,以及面向更大模型的商业微调服务。
- 基准门——新 adapter 只有在固定基准上胜过基线、且不使冻结回归集退化(防遗忘)时才保留。更差的 adapter 被丢弃,绝不部署。
- 巩固 rebase——一旦教训烙进权重,对应的记忆条在召回中退位(降权,而非删除),使快慢两层不重复注入同一知识。若教训仍复发,它会重新浮出——这是微调没吃进去的信号。
由于模型是严格类型化工具的客户端,OLAV 从不依赖微调:更好的权重减少错误,工具契约兜住其余。
第 3 层 — harness(配置调优)¶
Agent Harness 是模型周围的脚手架——上下文预算、注入多少条记忆(recall_top_k)、结果上限、运行哪些中间件。这些是按模型档位校准的默认值。OLAV 逐 run 记录结构化的 harness 遥测(哪些旋钮生效、召回条数、预算跳过、grader 判决、工具选择失败),全部可与该 run 的结果关联。
基于这些数据,OLAV 能提案一个旋钮变更("小档在 recall_top_k=1 时失败更多——试试 2"),用同一个基准门验证,并作为可逆的配置覆盖应用——但仅在人工批准之后。结构性与安全不变量、以及固定基准本身,永不自动调优。
治理:三层为何不冲突¶
三种规范行为的东西若不显式约定就可能冲突。OLAV 把契约写明([ADR-0016]):
- 放置——硬性/安全/结构规则放 harness;可学习的领域教训放记忆;反复验证的能力毕业到权重。冲突来自把规则放错层,而非"有三层"。
- 优先级——harness 硬约束与输出 grader 高于注入的记忆建议,记忆建议高于模型烙进的先验。安全永不被学来的教训覆盖。
- 变更权限——与层的权威成反比:记忆自我编辑(廉价、可逆),权重需要基准门,harness 需要基准门加上人。
结果是一套自我改进的系统:持续适应(记忆)、审慎巩固(权重)、谨慎调优自身脚手架(harness)——各以恰当的速度、在恰当的护栏之下。