在本地复现 ENGRA-KB-v2 基准测试
下载 JSON 套件、使用相同 embedder 与查询集,在迁移生产记忆库前对比结构化 Atom 与分块 RAG。
套件内容
ENGRA-KB-v2 包含: • 550 篇合成企业文档 • 400 条带相关性标注的查询 • 预计算的 Atom 图与分块基线 • BM25、chunk-512 RAG、结构化 Atom 的结果
报告指标
Recall@10 — 正确文档是否出现在前十? MRR — 第一个相关结果排名多高? Latency — 参考硬件上的端到端检索耗时(各套件文档中有说明)。
ENGRA-KB-v2 上结构化 Atom 为 75.3% Recall@10,固定分块 RAG 为 54.8%。分析见 Atom vs RAG 文章。
公平对比清单
• 各方案使用相同 embedder(默认 Xenova/all-MiniLM-L6-v2)。 • 不要只为 Atom 方案调 chunk 大小。 • 查询文本保持一致——不要按流水线改 prompt。 • 同时报告 Recall@10 与 MRR;只看 recall 会掩盖排序退化。
本地复现之后
将生产语料切片导入预发库,为首要场景建模 Library/Scope/Topic,再与现有栈做 Atom 检索 A/B。
预发指标优于基线后,通过 Memory MCP 或 Gateway 路由 接入 Agent。