主题
易变事实 SSOT(versions.md)
定位: 全仓库唯一记录"当前时点数据"的文件——模型名、价格量级、校准记录。阶段文档与每日计划中涉及这些数字时,链接到这里,不要复制。 分工: toolkit.md 保留选型知识(比较性论述,如"Chroma 适合学习"——相对稳定);本文件只放时点数据(如"当前主力是哪个型号、多少钱"——易变)。 工具版本的 SSOT 是各项目的
pyproject.toml:版本锁定跟代码走,文档一律不写具体版本号,避免两处维护。 校准节奏: 每季度初过一遍文末校准清单,改完更新"上次校准"日期。校准时逐一核对官方定价页 / 控制台可用列表,不要凭记忆改。
校准记录
| 日期 | 范围 | 备注 |
|---|---|---|
| 2026-07 | 初版 | 数据原样迁移自各阶段文档,未逐项重新核验 |
| 2026-Q4(计划) | 全量 | 首次季度校准:模型 / 价格核对 + 首次 JD 市场扫描 |
当前主力模型(上次校准:2026-07)
| 厂商 | 当期主力 | 学习用别名 | 备注 |
|---|---|---|---|
| OpenAI | GPT-5 系列(含推理 o 系列) | gpt-5-latest | 综合能力最强,生产首选 |
| Anthropic | Claude 4.5+(Sonnet / Opus) | claude-sonnet-4-5-latest | 长文档、Agent、Tool Use 生态友好 |
| DeepSeek | R1 / V3 | — | 国内可用、推理强、最便宜之一 |
| 通义千问 | Qwen 系列 | — | 国内项目、中文场景 |
| 智谱 GLM | GLM 系列 | — | 国内项目 |
| Moonshot | Kimi 系列 | — | 长上下文、国内 |
| Gemini 2.x(含 Thinking) | — | 超长上下文(1M)、多模态 | |
| 开源 | Llama / Qwen / DeepSeek 开源版 | — | 本地部署、微调、数据敏感 |
版本策略不变量(属选型知识,过期也会对): 学习用
-latest别名;回归评测锁固定 snapshot;生产用模型路由 + 固定版本 + 保留回滚基线。详见总览·模型版本策略。
价格量级(上次校准:2026-07,仅供预算参考)
| 项目 | 量级 | 备注 |
|---|---|---|
| 经济档模型输入 | ~$0.1-1 / 1M tokens | 开发调试用(DeepSeek / Haiku / GPT mini) |
| 旗舰档模型输入 | ~$3-15 / 1M tokens | 评测与上线前验证用 |
| Embedding(text-embedding-3-small) | $0.02 / 1M tokens | 不要无脑用 large |
| 全路线 API 预算 | $87-175(约 600-1200 元) | 分阶段明细见总览·学习成本估算 |
季度校准清单(每季度初过一遍,改完更新上方校准记录)
技术校准:
- [ ] 主力模型表:逐厂核对官方定价页与控制台可用列表,更新型号与价格量级
- [ ] 各阶段文档抽查:确认没有新写入的具体模型名 / 价格(应链接到本文件)
- [ ] 工具版本:抽查各
pyproject.toml依赖是否需要升级(LangGraph / SDK 大版本变化时评估教学示例是否受影响)
市场校准(押注的是"前端 + Agent 复合人才需求极大"这个假设,假设本身也要校验):
- [ ] 扫 20 条 Agent / LLM 工程师 JD(BOSS 直聘、LinkedIn),记录高频技能词:__
- [ ] 对照高频词,检查后续阶段的 P1/P2 优先级是否需要调整(如 JD 普遍要求某框架 / 某技能而路线排在 P2 → 提级)
- [ ] 记录市场变化结论:__
数据回填:
- [ ] 检查各阶段耗时参考表是否已从每周复盘回填实测数据