跳到主要内容
印格

L0–L3 唤醒栈:Agent 如何加载合适深度的记忆

L0 身份、L1 叙事、L2 主题召回、L3 深度搜索——何时 wake_up / recall / search,以及扁平 RAG 上下文为何浪费 token。

扁平上下文的问题

每轮都塞入「top-k 分块」等于假设所有任务同样吃记忆。修 linter 不需要完整客户叙事;谈定价则需要。扁平流水线过度注入上下文、浪费 token,分块跨界时仍找不到正确事实。

Engra 概念指南 定义四层,每层回答「此刻 Agent 该记住什么」的不同问题。

逐层说明

L0 — 身份:Agent 为谁服务?稳定特质、语气、角色边界。通过 memory_wake_up 与 L1 一并加载。

L1 — 核心叙事:进行中的故事——项目目标、活跃客户、当前冲刺主题。属于 wake_up 输出,保证每次会话起点一致。

L2 — 主题召回:主题级摘要与聚类 Atom。已知主题范围但需要广度时用 memory_recall

L3 — 深度语义搜索:Atom 级向量检索。问题具体或跨主题时用 memory_search

如何选择调用

会话开始 → wake_up(L0+L1)。 中途换主题 → recall(L2)。 查具体事实 → search(L3)。 新的持久信息 → save_atom 并填写 Library/Scope/Topic。

Skills 记录这一决策树,避免 IDE Agent 每条消息都 search。参见 Agent Skills 指南生产环境 Skill 工作流

可解释性

每层返回 Atom ID 与路径回链。可记录每轮注入的记忆——对合规场景与调试幻觉引用至关重要。