展开菜单

Happy-LLM 学习笔记 07:从预训练到 LoRA,训练流程要先看数据和成本

第五章是手写一个小 LLM,第六章的重点则变成:真正做训练时,为什么大家通常不会一直停留在手写训练循环里。答案很现实,模型结构、数据处理、分布式训练、checkpoint 恢复、日志监控和参数高效微调,每一项单独看都不难,合在一起却很容易把实验搞乱。 这一章给我的最大启发是:训练流程不是“模型 forward 一下再 backward 一下”,而是一条必须能被恢复、能被复现、能控制成本的流水线。先想明白数据要学什么、资源能承受什么,再决定 Pretrain、SFT 还是 LoRA,比先写训练脚本重要得多。 从手写实现转向 Transformers 生态 手写模型和训练流程很适合理解原理,...

在 JetBrains IDE 中接入 OpenCode 并配置自定义模型

在 JetBrains IDE 中接入 OpenCode 并配置自定义模型

OpenCode 是一款开源 AI 编程代理,目前在 GitHub 上拥有超过 16 万颗 Star,月活开发者超过 750 万。它支持终端、桌面应用和 IDE 扩展等多种使用方式,并且由于隐私优先的设计——不存储你的代码和上下文数据——在对隐私敏感的开发环境中也能放心使用。 OpenCode 的一个核心优势是模型无关性。它基于 AI SDK 构建,支持 75+ 家 LLM 提供商,包括 Anthropic、OpenAI、Google、DeepSeek 等,同时也支持通过 Ollama 运行本地模型。这意味着你不会被绑定在某一家的订阅服务上,可以根据预算和需求灵活切换。 对于 Androi...

中文内容创作者,必装的 10 个 Skill

中文内容创作者,必装的 10 个 Skill

中文内容创作者,必装的 10 个 Skill 在 AI 辅助创作的时代,工具的选择决定了内容的上限。与其让 AI 泛泛而谈,不如用专业的 Skill 把它变成你的专属编辑、设计师和研究员。 以下为你精选了 10 个能显著提升中文内容创作效率与质量的 Skill,覆盖了从选题、写作、润色到视觉包装的全流程。 ️ 写作与润色 Humanizer-zh 功能:中文“去 AI 味”神器。 亮点:由“归藏”汉化,专门针对 AI 写作中常见的空话、套话、三段式、过度排比等“机器腔”进行优化,让文本读起来更像真人所写,自然流畅。 地址:http://github...

15天学会AI应用开发(十六)LangChain实现对话记忆功能

​模型本身是无状态的,也就是不具备记忆功能,单次对话无法留存上下文信息,多轮交互中会遗忘历史对话内容。用户之所以感觉AI工具拥有记忆,是因为AI工具给大模型封装了一层记忆。 LangChain作为主流的大模型应用开发框架,内置完善的记忆模块(Memory模块),能够高效管理对话历史记录,让AI实现逻辑连贯的多轮对话,接下来就介绍如何使用LangChain实现对话记忆功能。 一、记忆功能用到的组件说明 LangChain实现对话记忆功能要掌握下列三个核心组件,需三者配合才能完成上下文管理全流程: 1、对话历史存储组件 以ChatMessageHistory为核心,基于内存临时存储对话记...

把GEO托管做成可审计状态机:超级语言GEO的五类交付记录

企业已经做了监测、发了不少内容,AI答案里仍然没有这个品牌。此时真正缺的,往往不是再开一个账号或再加一批稿件,而是判断问题卡在事实、官方阵地、外部信源、用户意图竞争还是稳定运营,并把下一步动作、验收和复测连成一条记录。超级语言GEO把这类工作定义为持续托管问题,而不是单次内容生产问题。 一、品牌进度不能由一篇文章代表 一篇内容可以处于草稿、已审核、已提交、已公开或已验收状态,但这些状态不能代表整个品牌已经完成某个阶段。品牌可能同时拥有几十篇公开内容,却仍因企业资料网址错误、官网没有承载关键事实,或者采购问题下没有进入候选而停滞。 可以先把品牌级阶段和动作级状态分开: type Bran...

面向智能体的入门指南

本文档面向希望通过 AI 智能体(Agent)接入阿里云向量检索服务 DashVector 的开发者,提供 LLM 可消费的 API 文档结构和快速入门指导。 你能完成什么 通过本文档,AI 智能体可以: 理解 DashVector 核心能力:通过结构化的模块概览,快速了解 DashVector 支持的功能(Cluster 管理、Collection 管理、Partition 管理、向量管理等)。 获取 API 调用知识:每个模块的文档包含该模块的 API 操作列表、参数说明和使用示例,LLM 可直接从中学习如何调用 API。 掌握认证与鉴权:了解 D...

Happy-LLM 学习笔记 06:动手搭建一个小 LLM,最值得盯住哪些模块

这一章最有价值的地方,不是把一个完整的大模型“抄出来”,而是把一个小 LLM 从骨架、入口和训练三层拆开看。以前我总会先盯参数量和显卡,后来才发现,真正决定能不能跑通的,往往是模块之间的接口是否统一。 先把模型骨架搭对 k_model.py 里最先出现的是 ModelConfig。这件事看起来平常,但我觉得很重要:dim、n_layers、n_heads、n_kv_heads、vocab_size、max_seq_len 这些参数如果散落在脚本里,后面做训练、推理、导出和复现实验都会乱。把它们收束到配置类里,模型才真正变成一个可调组件,而不是一坨写死的代码。 在结构上,这个小 LLM 仍...

Agent 工程思考:从 ReAct 到 Agent Harness

Agent 工程思考:从 ReAct 到 Agent Harness

作者:vivo 互联网项目团队- Ding Junjie 从 ReAct 出发,文章讨论 Agent 工程如何从“模型循环”走向 Harness:通过前后端共享的 State Schema、运行事实和 UI 边界,让模型行为变成可交互、可恢复、可控制、可追溯的产品能力。 1分钟看图掌握核心要点 大模型不是马,是大脑,而且是一颗刚刚觉醒的大脑。 一、Agent 不止是 model+loop 早期我理解的Agent 工程,可以被写成一段伪代码: whilenot done: reason act observe 用户输入一句话,模型思考一下,决...

低成本代码生成新范式:多模型协作能否媲美Claude Fable 5

低成本代码生成新范式:多模型协作能否媲美Claude Fable 5

【技术干货】低成本代码生成新范式:多模型协作能否媲美Claude Fable 5? 在AI代码生成领域,高昂的模型费用与性能瓶颈始终是开发者心中的痛点。近期,一种“LongCat主写+Kimi/DeepSeek/小米Mimo等模型审查”的多模型协作方案引发热议,宣称效果堪比行业标杆Claude Fable 5,成本却仅为“几十分之一”。真相究竟如何?本文通过技术拆解与数据验证,带你一探究竟! 一、性能真相:接近但未超越,场景适配是关键 多模型协作方案的核心逻辑是:用LongCat承担主写任务,其他模型专注代码审查与优化。然而,与Fable 5的对比需理性看待: 1. 评测数据...