知识库
知识库是面向非结构化文档的云端数据集类型。上传 PDF / Word / PPT / Excel / Markdown / 文本 / HTML 文件,系统自动解析、分片并向量化,随后与结构化数据集一起被 Agent 检索使用。
创建
数据集 → 新增数据集 → 创建知识库。设置名称、描述(帮助 Agent 判断何时检索该库)、默认分块策略与 Embedding 模型。
- 结构感知分块(推荐):按文档标题与段落切分,并携带章节路径参与检索,最适合手册与规范类文档。
- 按行分块适合 FAQ / 条目型文档;定长分块用于无结构文本兜底。
- 分段长度 200–2000 字符(默认 800),可设置重叠。
文件管理
支持多文件上传,逐文件展示 解析 → 分块 → 向量化 进度,失败可单独重试。可用文件夹组织文件、下载原文,点开任意文件查看分片——可对单个文件用新参数重新分块,也可编辑 / 删除单个分片(人工编辑的分片在重新分块前始终保留)。
暂不支持无文本层的扫描件 PDF。
召回测试
召回测试页运行与线上完全一致的混合检索(语义向量 + 关键词):可调 Top-K、相似度阈值,并可开启 Rerank 精排(更准,稍慢)。
在对话中使用
像其他数据集一样把知识库挂载到任意 Space。Agent 获得 search_knowledge 工具,自行判断查文档还是查表——同一个问题可以两者并用(例如 SQL 出统计数字、运维手册出处理方案)。结果携带来源文件与页码,答案可溯源。
更换 Embedding 模型
可随时更换 Embedding 模型;已有分片在后台自动重新向量化,切换期间检索不中断。