自主 AI 是感知、行动、进化的闭环,安全边界贯穿始终
如何让一个 AI agent 在持续变化的环境中安全地存在、学习和成长?产品说明书回答不了这个问题。本书以 CodeCoder 的设计实录作答:把身份、能力、安全三个面向放进同一个感知—行动—进化的循环,并记录每一次决策及被否的方案。
自主进化的闭环
核心概念
文件系统即自我
Agent 的身份与状态不藏在内存里,而是落在文件系统中,可读、可迁移、可审计。
它回答了「我是谁」这个根本问题,是整个架构的第一块基石。
三分架构
把能力拆为 Tool、Skill、Capability 三层,分别对应原子操作、程序性知识与执行环境。
分层让系统能力可以渐进生长,新技能不必改动内核。
自撰安全回路
系统为自己撰写安全规则,再由独立机制审查并执行这些规则的回路设计。
自修改系统必须有信任边界,安全不能只靠开发者预设。
客观验收门
用可量化、可复现的标准判断 agent 产出是否合格的结构化关卡。
没有客观验收,自主运行就无从谈起,只能退回人工盯梢。
遗忘
上下文压缩与持久化管理中主动丢弃信息、保留要点的机制。
记住一切等于无法思考,学会遗忘才能持续运行。
全书地图
第一编:哲学基石
第三编:自我进化
读完这本书,你会明白
- 身份、能力、安全是同一问题的三个面向
- 被否的方案比最终方案更有参考价值
- 自修改系统必须先划清信任边界
- 自主运行以客观验收门为前提
- 系统要持续进化,架构本身也不例外