论文
优先读摘要、方法图、实验设置和局限;不要一上来陷入所有公式。下面按“对本手册的解释价值”收录原始论文。
延伸阅读
参考资料
- Attention Is All You Need — 2017 · Transformer 的起点,理解 attention、位置编码和并行训练。
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding — 2018 · 理解预训练-微调范式和双向编码器。
- Language Models are Few-Shot Learners — 2020 · GPT-3 与 in-context learning 的代表论文。
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — 2020 · RAG 原始范式,理解参数化/非参数化记忆结合。
- LoRA: Low-Rank Adaptation of Large Language Models — 2021 · 参数高效微调的经典方法。
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — 2022 · 理解推理提示为什么能提升复杂任务表现。
- ReAct: Synergizing Reasoning and Acting in Language Models — 2022 · Agent 中“推理 + 行动”循环的关键思想。
- Toolformer: Language Models Can Teach Themselves to Use Tools — 2023 · 理解模型如何学习何时调用工具。
- Direct Preference Optimization — 2023 · DPO 的核心来源,适合对比 RLHF。
- Visual Instruction Tuning — 2023 · LLaVA 代表论文,理解视觉指令微调。
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context — 2024 · 多模态与长上下文系统能力的代表性技术报告。
读论文的最小模板
- 这篇论文要解决什么失败模式?
- 它引入了什么新结构、训练方式或评估方式?
- 它的对照实验是否足够说明问题?
- 它的局限是什么?在生产系统里会怎么暴露?
- 它和本手册哪一页相关:Prompt、RAG、Agent、训练还是多模态?