展开菜单

Happy-LLM 学习笔记 07:从预训练到 LoRA,训练流程要先看数据和成本

第五章是手写一个小 LLM,第六章的重点则变成:真正做训练时,为什么大家通常不会一直停留在手写训练循环里。答案很现实,模型结构、数据处理、分布式训练、checkpoint 恢复、日志监控和参数高效微调,每一项单独看都不难,合在一起却很容易把实验搞乱。 这一章给我的最大启发是:训练流程不是“模型 forward 一下再 backward 一下”,而是一条必须能被恢复、能被复现、能控制成本的流水线。先想明白数据要学什么、资源能承受什么,再决定 Pretrain、SFT 还是 LoRA,比先写训练脚本重要得多。 从手写实现转向 Transformers 生态 手写模型和训练流程很适合理解原理,...

在 JetBrains IDE 中接入 OpenCode 并配置自定义模型

在 JetBrains IDE 中接入 OpenCode 并配置自定义模型

OpenCode 是一款开源 AI 编程代理,目前在 GitHub 上拥有超过 16 万颗 Star,月活开发者超过 750 万。它支持终端、桌面应用和 IDE 扩展等多种使用方式,并且由于隐私优先的设计——不存储你的代码和上下文数据——在对隐私敏感的开发环境中也能放心使用。 OpenCode 的一个核心优势是模型无关性。它基于 AI SDK 构建,支持 75+ 家 LLM 提供商,包括 Anthropic、OpenAI、Google、DeepSeek 等,同时也支持通过 Ollama 运行本地模型。这意味着你不会被绑定在某一家的订阅服务上,可以根据预算和需求灵活切换。 对于 Androi...