跳到主要内容
印格

在本地复现 ENGRA-KB-v2 基准测试

下载 JSON 套件、使用相同 embedder 与查询集,在迁移生产记忆库前对比结构化 Atom 与分块 RAG。

套件内容

ENGRA-KB-v2 包含: • 550 篇合成企业文档 • 400 条带相关性标注的查询 • 预计算的 Atom 图与分块基线 • BM25、chunk-512 RAG、结构化 Atom 的结果

基准下载页 获取产物;指标定义见 方法论文档

报告指标

Recall@10 — 正确文档是否出现在前十? MRR — 第一个相关结果排名多高? Latency — 参考硬件上的端到端检索耗时(各套件文档中有说明)。

ENGRA-KB-v2 上结构化 Atom 为 75.3% Recall@10,固定分块 RAG 为 54.8%。分析见 Atom vs RAG 文章

公平对比清单

• 各方案使用相同 embedder(默认 Xenova/all-MiniLM-L6-v2)。 • 不要只为 Atom 方案调 chunk 大小。 • 查询文本保持一致——不要按流水线改 prompt。 • 同时报告 Recall@10 与 MRR;只看 recall 会掩盖排序退化。

本地复现之后

将生产语料切片导入预发库,为首要场景建模 Library/Scope/Topic,再与现有栈做 Atom 检索 A/B。

预发指标优于基线后,通过 Memory MCPGateway 路由 接入 Agent。