Skip to content

知识库

知识库是面向非结构化文档的云端数据集类型。上传 PDF / Word / PPT / Excel / Markdown / 文本 / HTML 文件,系统自动解析、分片并向量化,随后与结构化数据集一起被 Agent 检索使用。

创建

数据集 → 新增数据集创建知识库。设置名称、描述(帮助 Agent 判断何时检索该库)、默认分块策略与 Embedding 模型。

  • 结构感知分块(推荐):按文档标题与段落切分,并携带章节路径参与检索,最适合手册与规范类文档。
  • 按行分块适合 FAQ / 条目型文档;定长分块用于无结构文本兜底。
  • 分段长度 200–2000 字符(默认 800),可设置重叠。

文件管理

支持多文件上传,逐文件展示 解析 → 分块 → 向量化 进度,失败可单独重试。可用文件夹组织文件、下载原文,点开任意文件查看分片——可对单个文件用新参数重新分块,也可编辑 / 删除单个分片(人工编辑的分片在重新分块前始终保留)。

暂不支持无文本层的扫描件 PDF。

召回测试

召回测试页运行与线上完全一致的混合检索(语义向量 + 关键词):可调 Top-K、相似度阈值,并可开启 Rerank 精排(更准,稍慢)。

在对话中使用

像其他数据集一样把知识库挂载到任意 Space。Agent 获得 search_knowledge 工具,自行判断查文档还是查表——同一个问题可以两者并用(例如 SQL 出统计数字、运维手册出处理方案)。结果携带来源文件与页码,答案可溯源。

更换 Embedding 模型

可随时更换 Embedding 模型;已有分片在后台自动重新向量化,切换期间检索不中断。

Datyo · Agent 原生的智能数据分析底座