大模型 RAG 实战:从零搭建专属知识库问答助手
从文档切片、向量入库到检索生成,完整走通「提问 → 检索 → 回答」闭环。文中给出本地 FAISS 与一站式平台两条落地路径,并列出基础问题、模糊问题、无相关内容三类测试方法。
个人知识、教程与技术笔记,近期聚焦大模型应用与工程实践。
从文档切片、向量入库到检索生成,完整走通「提问 → 检索 → 回答」闭环。文中给出本地 FAISS 与一站式平台两条落地路径,并列出基础问题、模糊问题、无相关内容三类测试方法。
把提示词拆成「角色 → 目标 → 约束 → 示例」四段式结构,配合改造前后的对比示例,说明为什么同一个问题换种写法,输出质量会明显不同。
从窗口管理、消息编排、记忆压缩到检索增强四条主线展开,解释如何在有限的上下文预算内分配系统指令、历史对话与外部知识,避免检索内容挤占核心空间。
三阶段递进:先用 LoRA 微调提升输出格式准确率,再用 AWQ 量化配合 FastAPI 完成服务化部署,最后构建能够自主选择工具并生成调用参数的多工具 Agent。
面向入门者的技术栈梳理 —— 数据构建与清洗、基础模型选择、QLoRA 微调配置、训练监控到评估部署,逐个环节说明个人开发者如何用有限资源跑通全流程。
梳理 LLM + RAG、工作流、Multi-Agent 三种主流构建模式的适用边界,并汇总文旅、传媒、金融等行业的落地数据,可作为智能体方案选型时的参考。