跳到主要内容

3 篇博文 含有标签「文档处理」

查看所有标签

WeKnora 自适应分片机制:三层策略、文档画像与父子分块

· 阅读需 14 分钟
一介布衣
全栈开发者

做 RAG 的人迟早会撞到一堵墙:检索命中率上不去,答案总是缺上下文,或者命中的块跟问题根本不相关。排查到最后,问题往往不在模型、不在向量库,而在最前面那一步——分片(chunking)。

大多数项目的分片逻辑简单粗暴:按固定字符数切,加个 overlap 完事。这在一篇结构规整的文章上凑合能用,但真实世界的文档千奇百怪——有带规范标题的技术手册,有 OCR 出来的、连标题都没有的扫描件,有 FAQ 那样的原子条目,也有长篇叙事报告。用同一把尺子去量所有文档,注定顾此失彼。

WeKnora 的分片器(Go 侧 internal/infrastructure/chunker 包)给出的答案是一套自适应架构。这是系列第二篇,我按源码把它逐层拆开。

MarkItDown — 微软开源的文件转 Markdown 利器

· 阅读需 5 分钟
一介布衣
全栈开发者

做 LLM 应用的人大概都遇到过同一个头疼问题:用户丢过来一个 PDF、一个 Word、一张截图、一段录音,然后问你"能不能帮我总结一下?"

每种格式都要找对应的解析库,PDF 用 PyMuPDF、Word 用 python-docx、Excel 用 openpyxl、图片还得上 Tesseract OCR……写完一堆胶水代码,发现提取出来的文本结构全丢了——标题变普通段落、表格变乱码、链接直接蒸发。

微软开源的 MarkItDown 就是来解决这个问题的。

MinerU — 把 PDF 变成 LLM 能吃的结构化数据

· 阅读需 6 分钟
一介布衣
全栈开发者

上篇写了 MarkItDown,微软出的通用文件转Markdown 工具。今天这篇聊 MinerU——一个更专注、更狠的文档解析引擎。

如果说 MarkItDown 是"瑞士军刀",什么格式都能转;那 MinerU 就是"手术刀",专门对付最难啃的 PDF——扫描件、多栏排版、跨页表格、数学公式、手写体,这些让普通解析器哭出来的场景。