入门:搭起概念骨架
先理解模型如何表示文字、利用上下文并产生下一个 token。
- 分词、向量与位置
- 注意力与 Transformer
- 预训练与上下文窗口
大模型知识学习
正在载入学习笔记
LEARNING PATH
不追逐零散技巧,按基础、方法和工程三个层次建立知识之间的联系。
先理解模型如何表示文字、利用上下文并产生下一个 token。
把“感觉更好”变成可以重复、对比和解释的观察结果。
让模型在受控工具、可追踪数据和明确失败路径中完成任务。
SELECTED NOTES
每篇笔记都尽量回答“它是什么、为什么成立、在哪里会失效”。
从查询、键和值的角色出发,理解模型为什么能够为当前 token 选择不同的上下文信息。
阅读全文把切片、召回、重排、引用和拒答连成一条可诊断的链路,才能判断错误从哪里发生。
阅读全文一套小而稳定的样本、评分规则与失败分类,比单次演示更能说明改动是否有效。
阅读全文MODEL WATCH
模型观察不是排行榜,而是围绕任务、证据和失败模式整理的阶段性记录。
窗口变长扩大了可输入范围,但信息位置、干扰内容和任务结构仍会影响提取质量。
参数验证、权限边界、超时和重试决定了 Agent 系统能否稳定,而不只是模型会不会选工具。
结构化输出减少解析歧义,但仍需验证字段、范围和业务约束,不能只检查 JSON 是否有效。