Files
RAG-CUT/docx/extracted_requirements.txt
2026-07-16 11:12:17 +08:00

41 lines
1.8 KiB
Plaintext
Raw Permalink Blame History

This file contains invisible Unicode characters
This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
Pages: 3
Path: C:\Users\24019\Desktop\RAG-cut\docx\自研搭建AI助手知识库.pdf
============================================================
PAGE 1 | images=1 text_blocks=17
============================================================
自研搭建AI助手知识库​
背景​
AFE有自建自有知识库功能,但知识库的切片效果不佳,存在两个问题:​
1、文档处理能力不足:包括word/pdf/excel文档中的图片、表格无法有效提取处理;​
2、切片规则不佳:如下图一段文本被强硬拆分在两个不同的片段;​
任务​
搭建一个AI助手知识库demo,能支持上传文件,查看切片效果;可以测试召回效果,查看召回入参和
回参;​
目标​
目标:首要做好切片,其次是召回。​
支持文档类型:​
pdf、doc、docx、ppt、pptx、wps、ppsx​
xlsx、xls、csv、md、txt、html、json、xml、log​
jpg、png、jpeg、bmp、gif​
切片规则:​
表格文档:默认切分/按行切分​
其他文档:默认切分/通用标识符切分​
============================================================
PAGE 2 | images=2 text_blocks=6
============================================================
切片内表格:Markdown格式​
期望​
期望效果(基础):​
1. 图片展示在原文本展示的问题,不会丢失或者移动到其他位置​
2. 表格内容正确提取,并整理为markdown文本​
3. 切片规则合理,对于word至少同一个标题下的内容在一个切片中​
============================================================
PAGE 3 | images=4 text_blocks=3
============================================================
期望效果(高级):​
1. 对图片图形能够提取为图片,且识别文本信息转为文字​
2. 对pdf水平分布的栏目文本能够识别为正常顺序​