原始资料
PDF、Word、网页、飞书、Notion、业务数据、客服记录、音视频。
向量数据库、知识图谱、RAG、Agent、DeepResearch 不是同一层级的技术。把它们放进一条数据从“原始资料”流向“业务应用”的链路里,关系就会清楚很多。
PDF、Word、网页、飞书、Notion、业务数据、客服记录、音视频。
上传、API 同步、爬虫、Browser、Search API、数据库同步。
去噪、去导航、段落切分、chunk 生成、元数据标注。
把文本切片转成向量,便于语义相似检索。
Postgres 存业务状态,Qdrant / pgvector 存向量,Neo4j 存关系。
关键词 + 向量 + 图检索召回候选,再用 reranker 提升质量。
拼接上下文,结构化输出,给引用,做事实校验和防幻觉。
规划、调工具、查库、浏览、写报告、触发业务动作。
| 层级 | 解决的问题 | 典型技术 | 工程关注点 |
|---|---|---|---|
| 数据接入 | 资料从哪里来 | 上传、爬虫、API、数据库同步、OCR、ASR | 来源可靠性、权限、增量更新、失败重试 |
| 数据处理 | 怎么变成 AI 能用的知识 | 清洗、切分、元数据、Embedding、NER、关系抽取 | chunk 粒度、元数据质量、抽取准确率 |
| 存储 | 知识放在哪里 | Postgres、Qdrant、Milvus、Neo4j、Elasticsearch、S3 | 组合选型、成本、查询性能、数据一致性 |
| 检索 | 怎么找到相关资料 | 关键词检索、向量检索、图检索、混合检索、rerank | 召回率、精确率、Top K、上下文压缩 |
| 生成 | 怎么回答或输出结果 | Prompt、Function Calling、Structured Output、Citation、Guardrails | 防幻觉、引用来源、格式稳定、越权保护 |
| 编排 | 复杂任务怎么多步骤执行 | Agent、LangGraph、LlamaIndex Workflow、CrewAI、AutoGen | 状态机、工具调用、观察结果、错误恢复 |
| 应用 | 给用户什么能力 | RAG 问答、DeepResearch、客服分析、自动报告、业务自动化 | 产品体验、结果可信度、业务闭环 |
存文档切片的 embedding,擅长找语义相似内容。它是存储层,不是完整问答系统。
存实体和关系,擅长多跳关系、来源一致性、品牌和产品关联分析。
基于已有资料回答问题,核心链路是检索、重排、上下文构造、LLM 生成。
负责规划任务、选择工具、执行动作、观察结果,再继续决策。
研究型 Agent 流程:拆问题、搜索、阅读、验证、补充搜索、生成报告。
最终面向用户的产品形态,可以包装成知识库、分析平台、自动化助手或报告系统。
客户身份、会员等级、历史订单、历史咨询和售后偏好。
购买记录、商品明细、支付状态、物流状态和退款进度。
退换货、物流延迟、质量争议、发票开具、优惠券使用等类型。
购买、咨询、投诉、引用政策、转人工、升级工单、已解决。
发现高频售后问题、流程堵点、知识库缺口和可自动化处理的场景。