Naive RAG
本指南将指导您如何在基于国产算力卡 曦云 C500与 燧原 S60 ,通过 vLLM 提供推理服务,结合 LlamaIndex 框架与 Milvus Lite 本地向量数据库,实现了一套完全私有化的 Naive RAG 系统。
一、框架概览
-
数据层:
- 内置示例数据集:平台在内置路径中预置了 “算力市场文档” 等专业数据集。用户无需繁琐的数据准备,即可通过调用内置库实现 “一键上手”,快速验证 RAG 流程的闭环性。
- 私有数据接入:系统具备高度的灵活性,支持用户通过数据通道自行上传 PDF、Markdown 等私有文档。通过简单的路径配置,即可实现从公共知识到行业私有知识的无缝切换。
-
推理层:
- 核心引擎:采用 vLLM 作为推理后端,利用其 PagedAttention 技术提升并发处理能力。
- 启动策略:执行显存割让策略(如 40% 显存用于 LLM),为后续的向量化模型预留必要的计算空间。
-
数据存储与检索层:
- 本地向量库:集成 Milvus Lite。不同于集群版,Lite 版作为嵌入式库运行,仅通过 Python 加载即可操作本地 .db 文件,无需部署额外的数据库服务或维护复杂的容器集群,即可在单机实现百万级检索。
- 嵌入模型(Embedding):调用内置库加载 Qwen3-Embedding 系列模型,将 PDF/文本等非结构化数据转化为高维语义向量。
-
逻辑编排层:
- 工作流管理:基于 LlamaIndex 框架,定义文档读取(SimpleDirectoryReader)、切分(TextSplitter)、索引构建与查询路由。
- Naive RAG 范式:遵循标准的 索引 — 检索 — 生成 直线型逻辑,确保系统结构简洁且易于维护。
-
流程图:
-
文档:

-
代码:

-
二、沐曦 (MetaX) 部署指南
本章节适用于 曦云 C500 等沐曦系列算力卡。
1. 硬件与基础环境
- 算力型号:曦云 C500 (64GB) * 1
- 算力主机:
- jiajia-mxc:
vLLM / vllm:0.11.0 / Python 3.10 / maca 3.3.0.11
- suanfeng-mxc:
vLLM / 0.10.2 / Python 3.10 / maca 3.2.1.3
- jiajia-mxc: