Skip to content

实践项目

学习 LLM 最容易掉进“看懂了但不会做”的坑。这里按难度列出项目,你可以把它们当成每个模块的验收题:做完一个,再回去补理论。

实践项目的目标不是堆更多 SDK,而是建立一套能复盘的工程闭环:输入样本、系统 trace、评估指标、失败分类和下一步实验。只要这五件事缺一件,项目就很难从 demo 走向可靠系统。

此外,我也把 CSDN 最新 30 篇文章做了站内全文镜像:偏 Agent、Prompt、RAG、MCP、Training、多模态的文章会进入对应知识模块,偏文件上传、连接池、SSRF、Celery、权限系统等工程主题的文章收在 CSDN 镜像 / 工程实践

入门项目

结构化摘要器

  • 目标:把长文本压缩成固定 JSON/Markdown 结构。
  • 建议阅读Prompt 基础上下文工程
  • 验收标准:同一输入多次运行时,结构稳定且字段可解析。

文档问答 Demo

  • 目标:上传 5-20 篇文档并回答问题。
  • 建议阅读RAG 全景文档切分
  • 验收标准:答案带引用,缺少证据时能明确说“不知道”。

简单工具调用

  • 目标:让模型调用计算器、搜索或内部 API。
  • 建议阅读工具调用
  • 验收标准:工具参数可校验,失败时能重试或给出降级回答。

进阶项目

可评估 RAG

  • 目标:建立 query 集、人工答案和自动指标。
  • 建议阅读RAG 评估评估指标
  • 验收标准:每次改 chunk、召回或重排,都能看到指标变化。

多步骤 Agent

  • 目标:让 Agent 拆任务、调用工具并生成执行记录。
  • 建议阅读规划异常处理
  • 验收标准:支持中途失败、重试、人工确认和执行回放。

MCP 小服务

  • 目标:把一个本地/业务能力封装成 MCP server。
  • 建议阅读MCP 快速入门核心概念
  • 验收标准:Host 能发现工具,并按权限边界调用。

LoRA 小实验

  • 目标:用小数据集微调一个轻量模型。
  • 建议阅读训练数据LoRA
  • 验收标准:有训练/验证拆分、基线对照和失败样本分析。

生产级项目

企业知识库 RAG

  • 目标:支持权限、增量索引、引用和反馈闭环。
  • 建议阅读RAG 生产实践Checklist
  • 验收标准:有召回评估、引用审计、成本/延迟监控和回滚策略。

客服/运营 Agent

  • 目标:多工具协作,关键动作需要确认。
  • 建议阅读Agent 安全评估与监控
  • 验收标准:有审批流、工具白名单、失败回放和人工接管路径。

模型评估平台

  • 目标:管理样本、指标、回归和模型版本。
  • 建议阅读训练评估评估指标
  • 验收标准:能比较版本,并阻止明显回归发布。

多模态知识助手

  • 目标:对图表、截图或视频片段做检索和问答。
  • 建议阅读多模态 RAG 与 Agent
  • 验收标准:图文引用可追溯,错误样本可复盘。

做项目时的记录模板

每个项目至少记录这些信息:

  1. 目标:要解决谁的什么问题。
  2. 数据:来源、规模、清洗规则、敏感信息处理。
  3. 模型:版本、参数、上下文长度、调用成本。
  4. 评估:样本集、指标、人工复核规则。
  5. 失败案例:至少 10 个真实失败样本和原因分类。
  6. 下一步:继续优化前,先说明最可能的瓶颈。

可复用模板见 模板

项目质量评分

维度低分表现高分表现
可复现只在本机手动跑通过有固定样本、配置和运行说明
可观察只保存最终回答保存检索、上下文、工具调用和错误
可评估靠主观感觉判断好坏有离线样本、指标和失败分类
可控风险模型输出直接写入系统有权限、校验、人工确认和回滚
可迭代改一次就不知道哪里变好每次实验都能比较基线和新版本

最后更新于:

基于 VitePress 构建