跳到主要内容

6 篇博文 含有标签「开源」

查看所有标签

WeKnora 架构全景:Go 与 Python 双引擎的企业级 RAG 框架

· 阅读需 9 分钟
一介布衣
全栈开发者

最近想找一个工程完成度足够高、又能拿来学 RAG 全链路的开源项目,翻了一圈最后停在腾讯开源的 WeKnora 上。它是 MIT 协议、当前版本 v0.8.2,把「文档理解 + 语义检索 + 自主推理」做成了一套可自托管的框架,代码结构比大多数 demo 级的 RAG 仓库认真得多。

我打算用一个系列把它拆开讲。这是第一篇,先建立整体认知:它分成哪几层、为什么主后端用 Go 而文档解析单独拎出一个 Python 服务、一条文档从上传到能被检索中间到底发生了什么。后面三篇分别深入分片机制、检索管线和 Agent 能力。

WeKnora ReAct Agent 与三大能力:从检索问答到自主推理

· 阅读需 9 分钟
一介布衣
全栈开发者

前三篇我们一路沿着数据流走下来:架构分层、文档怎么被解析分片、检索管线怎么把内容捞出来排序。但这些都还停留在「RAG」的范畴——用户问一句,系统检索一次、答一句,是被动的。

WeKnora 真正想做的不止于此。它在检索之上搭了一个 ReAct Agent,让系统能自己规划多步任务、调用工具、写代码、开浏览器、还能把一堆原始文档蒸馏成一个自维护的 Wiki。这是系列收官篇,我们看看问答之上的这层「自主推理」是怎么组织的,也顺便给整个 RAG 全链路收个口。

MarkItDown — 微软开源的文件转 Markdown 利器

· 阅读需 5 分钟
一介布衣
全栈开发者

做 LLM 应用的人大概都遇到过同一个头疼问题:用户丢过来一个 PDF、一个 Word、一张截图、一段录音,然后问你"能不能帮我总结一下?"

每种格式都要找对应的解析库,PDF 用 PyMuPDF、Word 用 python-docx、Excel 用 openpyxl、图片还得上 Tesseract OCR……写完一堆胶水代码,发现提取出来的文本结构全丢了——标题变普通段落、表格变乱码、链接直接蒸发。

微软开源的 MarkItDown 就是来解决这个问题的。

MinerU — 把 PDF 变成 LLM 能吃的结构化数据

· 阅读需 6 分钟
一介布衣
全栈开发者

上篇写了 MarkItDown,微软出的通用文件转Markdown 工具。今天这篇聊 MinerU——一个更专注、更狠的文档解析引擎。

如果说 MarkItDown 是"瑞士军刀",什么格式都能转;那 MinerU 就是"手术刀",专门对付最难啃的 PDF——扫描件、多栏排版、跨页表格、数学公式、手写体,这些让普通解析器哭出来的场景。

小米 MiMo V2.5 — 全球开源第一的大模型,值得一试

· 阅读需 4 分钟
一介布衣
全栈开发者

最近大模型圈有个值得关注的事:小米的 MiMo V2.5 系列开放公测了,而且在 Artificial Analysis 榜单上拿下了全球开源大模型综合智能指数第一。

一个做手机和智能家居的公司,AI 模型做到开源第一?我一开始也觉得有点意外,试了一圈之后,确实有点东西。