# 腾讯云智能体开发平台:文档切分设置 > 来源页面:[腾讯云文档 - 文档切分设置](https://cloud.tencent.com/document/product/1759/122551) > 页面最近更新时间:2025-12-31 16:49:32 > 整理说明:本文为根据页面内容整理的 Markdown 版,保留核心概念、功能入口、规则对比和关键参数说明,并非网页原文逐字复制。 ## 1. 功能概述 文档切分是指系统按照一定规则,将上传到知识库的文档拆分为多个独立切片。切片会被索引并存储,是 RAG(Retrieval-Augmented Generation,检索增强生成)流程中的关键环节。 在问答场景中,系统通常会先根据用户问题检索相关切片,再把命中的切片作为外部知识放入大模型上下文,从而辅助模型生成答案。 切分粒度会直接影响检索质量和回答效果: - 切片过大:容易包含无关内容,降低检索精度,也会增加上下文和计算资源消耗。 - 切片过小:上下文不完整,知识片段更碎片化,可能导致回答不够全面。 - 合理切分:需要在检索效率、上下文完整性和生成质量之间取得平衡。 ## 2. 切分规则类型 平台支持两类文档切分方式: - 默认切分规则:由平台使用模型能力自动切分,用户不能直接干预具体规则。 - 自定义切分规则:用户可根据业务需求设置切分方式,主要包括通用标识符切分、父子标识符切分和按行切分。 ## 3. 切分规则对比 | 切分方式 | 适用文档类型 | 典型使用场景 | 核心逻辑 | |---|---|---|---| | 默认切分 | 平台支持导入的全部文档类型 | 对切分无特殊要求的知识库文档 | 基于切分模型处理,关注语义完整性、复杂元素解析和表格处理 | | 通用标识符切分 | 非表格类文档,不包括 xlsx、xls、csv | 需要按页码、自定义符号或业务段落进行切分 | 用户设置标识符、最大长度和重叠长度,切片同时用于检索和召回 | | 父子标识符切分 | 非表格类文档,不包括 xlsx、xls、csv | 检索粒度和召回粒度需要分离的场景 | 子级切片用于检索,命中后召回对应父级切片给大模型 | | 按行切分 | 表格类文档,包括 xlsx、xls、csv | 表格每行或每几行相对独立,如商品 SKU 文档 | 用户设置表头范围、起始行和每个切片包含的行数 | ## 4. 默认切分能力 默认切分由平台模型完成,适合大多数不需要精细控制切片边界的文档。 平台默认切分能力包括: - 支持按语义完整性切分。 - 支持跨页表格合并。 - 支持解析表格中的图片信息。 - 支持解析有线表格和无线表格。 - 支持解析数据图、流程图、架构图、思维导图。 - 支持处理多栏、公式、子图等复杂版式元素。 ## 5. 功能入口 ### 入口一:上传文档时设置 在知识库中上传文档时,流程通常包括: 1. 上传文档。 2. 设置文档切片。 3. 按文档类型对同一批上传文档生效。 图示来源: ![上传文档时设置切片](https://qcloudimg.tencent-cloud.cn/image/document/850228edf4f928244908151ebf3def0c.png) ### 入口二:已导入文档重新设置 对已经导入知识库的文档,可以重新设置切分规则: 1. 进入知识库。 2. 找到指定文档。 3. 点击文档右侧的“更多”。 4. 选择“解析切分干预”。 5. 查看解析切分结果。 6. 点击“文档切分设置”重新配置切分规则。 图示来源: ![已导入文档解析切分干预入口](https://qcloudimg.tencent-cloud.cn/image/document/66374f90956aff7df5f2432374de93fe.png) ![文档切分设置入口](https://qcloudimg.tencent-cloud.cn/image/document/ad265a826b49fdce18a9d2df579d6aa3.jpeg) 注意:重新设置文档切分规则后,系统会按照原文档重新切分,并覆盖之前干预过的切分结果。 ## 6. 表格文档切分 表格类文档包括 xlsx、xls、csv。平台对表格文档支持默认切分和按行切分。 ### 6.1 默认切分 默认切分会使用平台切分模型,根据表格行数、语义完整性等因素自动处理。 ### 6.2 按行切分 按行切分适合每行或每几行数据相对独立的表格,例如商品 SKU 表、配置清单、结构化数据表等。 关键参数如下: | 参数 | 说明 | |---|---| | 表头范围 | 选择表格中的表头行,每个切片都会包含表头数据;区间最大支持 5 行 | | 切分起始行 | 指定从哪一行开始切分;起始行不能与表头范围重复 | | 切分行数 | 指定每个切片从起始行开始包含多少行数据 | 示例:如果表头为第 1 行,切分起始行为第 2 行,切分行数为 1,则第一个切片为“表头 + 第 2 行”,第二个切片为“表头 + 第 3 行”,依此类推。 图示来源: ![表格按行切分设置](https://qcloudimg.tencent-cloud.cn/image/document/b95c810800d7527cf4949836022cd931.png) ## 7. 非表格文档切分 非表格类文档指知识库中除 xlsx、xls、csv 之外的文档类型。平台支持默认切分、通用标识符切分和父子级标识符切分。 ### 7.1 默认切分 默认切分会使用平台切分模型,根据语义完整性进行自动切分。 ### 7.2 通用标识符切分 通用标识符切分适合需要按特定符号或业务结构拆分文档的场景,例如按照 `###`、`***`、章节分隔符或自定义标记切分。 关键参数如下: | 参数 | 说明 | |---|---| | 标识符 | 系统按照用户设置的标识符切分文档;切分标识符不会出现在最终切片中 | | 切分最大长度 | 每个切片允许的最大字符数;如果按标识符切出的片段超过最大长度,会继续按长度拆分;最大不超过 4800 字符 | | 切分重叠长度 | 当片段超过最大长度需要继续拆分时,保留相邻切片之间的重叠字符,用于维持语义连续性 | 设置建议: - 切分重叠长度可设置为切分最大长度的约 10%。 - 切分重叠长度最高可设置为切分最大长度的 25%。 图示来源: ![通用标识符切分设置](https://qcloudimg.tencent-cloud.cn/image/document/0b906b04a6113b01ef0d0bb1fa03ebe1.png) ### 7.3 父子级标识符切分 父子级标识符切分适合需要“细粒度检索、粗粒度召回”的知识库场景。系统会先把文档拆成父级切片,再把父级切片拆成一个或多个子级切片。 工作方式: 1. 用户问题先检索子级切片。 2. 命中子级切片后,系统找到对应父级切片。 3. 父级切片被召回给大模型用于答案生成。 这种方式的优点是: - 子级切片更短,有利于提升检索精度。 - 父级切片保留更多上下文,有利于提高生成答案的完整性。 约束条件: - 子级切片最大长度不能超过父级切片最大长度。 - 子级切片最大可设置为 1500 字符。 - 子级切片与父级切片是一对一或多对一关系。 图示来源: ![父子级标识符切分说明](https://qcloudimg.tencent-cloud.cn/image/document/e4da303ed682cfb54af8f6965feb09fe.png) ![父子级切片关系](https://qcloudimg.tencent-cloud.cn/image/document/23608a42caddd6d221f53fa6103df1d3.png) ## 8. 切分内表格格式 平台支持设置文档中表格内容的切片格式: | 格式 | 特点 | |---|---| | Markdown 格式 | 默认格式,通常效果更好,便于模型理解表格结构 | | HTML 格式 | token 消耗相对更少 | 该设置对普通文档中的表格内容,以及表格文档中的内容均可生效。 ## 9. 使用建议 | 场景 | 推荐切分方式 | |---|---| | 普通知识库文档,无特殊切分要求 | 默认切分 | | 文档结构清晰,有固定章节、页码或分隔符 | 通用标识符切分 | | 希望检索更精准,同时召回更完整上下文 | 父子级标识符切分 | | 表格每行是独立数据,如商品、配置、SKU | 按行切分 | | 文档表格较多,且希望模型更好理解结构 | Markdown 表格格式 | | token 成本敏感,表格结构不复杂 | HTML 表格格式 | ## 10. 相关页面 - 上一篇:文档概述 - 下一篇:解析切分干预 - 原始页面:[文档切分设置](https://cloud.tencent.com/document/product/1759/122551)