AI Application Data Pipeline
RAG / Agent / DeepResearch / GraphRAG 工程视图

AI 应用的数据处理流水线

向量数据库、知识图谱、RAG、Agent、DeepResearch 不是同一层级的技术。把它们放进一条数据从“原始资料”流向“业务应用”的链路里,关系就会清楚很多。

一条主流水线

从资料进入系统,到最终变成答案、报告和自动化任务
1

原始资料

PDF、Word、网页、飞书、Notion、业务数据、客服记录、音视频。

2

采集 / 接入

上传、API 同步、爬虫、Browser、Search API、数据库同步。

3

清洗 / 切分

去噪、去导航、段落切分、chunk 生成、元数据标注。

4

Embedding

把文本切片转成向量,便于语义相似检索。

5

存储

Postgres 存业务状态,Qdrant / pgvector 存向量,Neo4j 存关系。

6

检索 / Rerank

关键词 + 向量 + 图检索召回候选,再用 reranker 提升质量。

7

LLM 生成

拼接上下文,结构化输出,给引用,做事实校验和防幻觉。

8

Agent / 应用

规划、调工具、查库、浏览、写报告、触发业务动作。

加上知识图谱之后

同一批资料会分成“文本切片”和“实体关系”两条线
文本切片路线Chunk → Vector
Chunk
文档切片把长文档拆成可检索的段落,保留来源、时间、栏目、权限等元数据。
Embedding
语义向量化使用 OpenAI、BGE、Jina、M3E 等模型,把文本变成向量。
Vector DB
向量数据库Qdrant、Milvus、pgvector、Chroma,适合找“语义相似”的内容。
实体关系路线Entity → Graph
Entity
实体抽取识别用户、订单、商品、工单、问题类型、处理人、政策条款。
Relation
关系抽取识别“购买”“关联”“触发”“处理”“引用”“升级”“解决”等关系。
Graph DB
图数据库 / DeepGraphNeo4j、NebulaGraph、ArangoDB,适合实体关系、多跳推理和一致性分析。

工程分层

每一层解决一个清晰问题
层级解决的问题典型技术工程关注点
数据接入资料从哪里来上传、爬虫、API、数据库同步、OCR、ASR来源可靠性、权限、增量更新、失败重试
数据处理怎么变成 AI 能用的知识清洗、切分、元数据、Embedding、NER、关系抽取chunk 粒度、元数据质量、抽取准确率
存储知识放在哪里Postgres、Qdrant、Milvus、Neo4j、Elasticsearch、S3组合选型、成本、查询性能、数据一致性
检索怎么找到相关资料关键词检索、向量检索、图检索、混合检索、rerank召回率、精确率、Top K、上下文压缩
生成怎么回答或输出结果Prompt、Function Calling、Structured Output、Citation、Guardrails防幻觉、引用来源、格式稳定、越权保护
编排复杂任务怎么多步骤执行Agent、LangGraph、LlamaIndex Workflow、CrewAI、AutoGen状态机、工具调用、观察结果、错误恢复
应用给用户什么能力RAG 问答、DeepResearch、客服分析、自动报告、业务自动化产品体验、结果可信度、业务闭环

关键概念怎么区分

不要把工具、流程和产品形态混在一起
Storage

向量数据库

存文档切片的 embedding,擅长找语义相似内容。它是存储层,不是完整问答系统。

Relation

知识图谱 / DeepGraph

存实体和关系,擅长多跳关系、来源一致性、品牌和产品关联分析。

Retrieval

RAG

基于已有资料回答问题,核心链路是检索、重排、上下文构造、LLM 生成。

Orchestration

Agent

负责规划任务、选择工具、执行动作、观察结果,再继续决策。

Research

DeepResearch

研究型 Agent 流程:拆问题、搜索、阅读、验证、补充搜索、生成报告。

Product

LLM 应用

最终面向用户的产品形态,可以包装成知识库、分析平台、自动化助手或报告系统。

三种落地路线

从小项目到业务分析平台,复杂度逐级增加
企业知识库问答
文档上传PDF / Word / 网页 / 飞书
解析切分chunk + metadata
向量入库Qdrant 或 pgvector
检索重排向量检索 + rerank
带引用回答LLM + citation
DeepResearch
研究主题用户输入问题
拆解计划Agent 生成子问题
搜索阅读Tavily / Browser / Playwright
证据沉淀向量库 + 可选图谱
研究报告Markdown + 引用
电商客服 / 售后分析
数据接入订单 / 商品 / 客服记录
问题归类退款 / 物流 / 质量 / 发票
抽取要素用户 / 商品 / 工单 / 政策
聚类建图Qdrant + Neo4j
优化建议高频问题 / 流程堵点 / 知识缺口

电商售后场景的图谱模型

适合用图数据库表达“用户、订单、商品、工单、问题、处理结果”的关系

用户

客户身份、会员等级、历史订单、历史咨询和售后偏好。

订单

购买记录、商品明细、支付状态、物流状态和退款进度。

问题

退换货、物流延迟、质量争议、发票开具、优惠券使用等类型。

关系

购买、咨询、投诉、引用政策、转人工、升级工单、已解决。

结论

发现高频售后问题、流程堵点、知识库缺口和可自动化处理的场景。

学习顺序

从最贴近真实项目的能力开始
先把 RAG 做扎实,再往 Agent、DeepResearch、GraphRAG 走。这样知识不会散,工程路径也最贴近真实 AI 应用开发。
1RAG:文档解析、切分、检索、生成答案
2向量数据库:Qdrant / pgvector
3混合检索 + rerank:提升召回和排序质量
4Agent / LangGraph:多步骤任务编排
5DeepResearch:搜索、阅读、验证、报告
6GraphRAG / DeepGraph:实体关系和多跳推理