实践项目
学习 LLM 最容易掉进“看懂了但不会做”的坑。这里按难度列出项目,你可以把它们当成每个模块的验收题:做完一个,再回去补理论。
实践项目的目标不是堆更多 SDK,而是建立一套能复盘的工程闭环:输入样本、系统 trace、评估指标、失败分类和下一步实验。只要这五件事缺一件,项目就很难从 demo 走向可靠系统。
此外,我也把 CSDN 最新 30 篇文章做了站内全文镜像:偏 Agent、Prompt、RAG、MCP、Training、多模态的文章会进入对应知识模块,偏文件上传、连接池、SSRF、Celery、权限系统等工程主题的文章收在 CSDN 镜像 / 工程实践。
入门项目
简单工具调用
- 目标:让模型调用计算器、搜索或内部 API。
- 建议阅读:工具调用。
- 验收标准:工具参数可校验,失败时能重试或给出降级回答。
进阶项目
生产级项目
多模态知识助手
- 目标:对图表、截图或视频片段做检索和问答。
- 建议阅读:多模态 RAG 与 Agent。
- 验收标准:图文引用可追溯,错误样本可复盘。
做项目时的记录模板
每个项目至少记录这些信息:
- 目标:要解决谁的什么问题。
- 数据:来源、规模、清洗规则、敏感信息处理。
- 模型:版本、参数、上下文长度、调用成本。
- 评估:样本集、指标、人工复核规则。
- 失败案例:至少 10 个真实失败样本和原因分类。
- 下一步:继续优化前,先说明最可能的瓶颈。
可复用模板见 模板。
项目质量评分
| 维度 | 低分表现 | 高分表现 |
|---|---|---|
| 可复现 | 只在本机手动跑通过 | 有固定样本、配置和运行说明 |
| 可观察 | 只保存最终回答 | 保存检索、上下文、工具调用和错误 |
| 可评估 | 靠主观感觉判断好坏 | 有离线样本、指标和失败分类 |
| 可控风险 | 模型输出直接写入系统 | 有权限、校验、人工确认和回滚 |
| 可迭代 | 改一次就不知道哪里变好 | 每次实验都能比较基线和新版本 |