Happy-LLM 学习笔记 06:动手搭建一个小 LLM,最值得盯住哪些模块
这一章最有价值的地方,不是把一个完整的大模型“抄出来”,而是把一个小 LLM 从骨架、入口和训练三层拆开看。以前我总会先盯参数量和显卡,后来才发现,真正决定能不能跑通的,往往是模块之间的接口是否统一。 先把模型骨架搭对 k_model.py 里最先出现的是 ModelConfig。这件事看起来平常,但我觉得很重要:dim、n_layers、n_heads、n_kv_heads、vocab_size、max_seq_len 这些参数如果散落在脚本里,后面做训练、推理、导出和复现实验都会乱。把它们收束到配置类里,模型才真正变成一个可调组件,而不是一坨写死的代码。 在结构上,这个小 LLM 仍...
Agent 工程思考:从 ReAct 到 Agent Harness
作者:vivo 互联网项目团队- Ding Junjie 从 ReAct 出发,文章讨论 Agent 工程如何从“模型循环”走向 Harness:通过前后端共享的 State Schema、运行事实和 UI 边界,让模型行为变成可交互、可恢复、可控制、可追溯的产品能力。 1分钟看图掌握核心要点 大模型不是马,是大脑,而且是一颗刚刚觉醒的大脑。 一、Agent 不止是 model+loop 早期我理解的Agent 工程,可以被写成一段伪代码: whilenot done: reason act observe 用户输入一句话,模型思考一下,决...
低成本代码生成新范式:多模型协作能否媲美Claude Fable 5
【技术干货】低成本代码生成新范式:多模型协作能否媲美Claude Fable 5? 在AI代码生成领域,高昂的模型费用与性能瓶颈始终是开发者心中的痛点。近期,一种“LongCat主写+Kimi/DeepSeek/小米Mimo等模型审查”的多模型协作方案引发热议,宣称效果堪比行业标杆Claude Fable 5,成本却仅为“几十分之一”。真相究竟如何?本文通过技术拆解与数据验证,带你一探究竟! 一、性能真相:接近但未超越,场景适配是关键 多模型协作方案的核心逻辑是:用LongCat承担主写任务,其他模型专注代码审查与优化。然而,与Fable 5的对比需理性看待: 1. 评测数据...
机器人公司密集发力:宇树冲刺IPO,智元量产破局
机器人公司密集发力:宇树冲刺IPO,智元量产破局 2026年7月,中国机器人产业迎来关键转折点。以宇树科技和智元机器人为代表的本土企业,在资本市场、量产交付和全球化认证等领域同时传出重磅消息,标志着行业正从技术展示迈入规模化商业落地的深水区。 宇树科技:拿下IPO批文,冲刺“人形机器人第一股” 资本市场的聚光灯已投向宇树科技。7月2日,证监会正式批复同意宇树科技科创板IPO注册申请,全部审核流程仅耗时104天,刷新科创企业上市速度纪录。这意味着A股“人形机器人第一股”即将正式诞生。 从招股书看,这家2016年成立的公司已实现盈利破局:2025年营收达16.99亿元,净利...
2026年全网最深入讲解大模型备案【附:评估测试题+备案参考文件】
文章目录 (一)适用主体 (二)语料安全 (三)模型安全 (四)安全措施要求 (五)词库要求 (六)安全评估要求 (七)附录大模型备案材料源文件 2024年3月1日,我国通过了《生成式人工智能服务安全基本要求》(以下简称《AIGC安全要求》),这是目前我国第一部有关AIGC服务安全性方面的技术性指导文件,对语料安全、模型安全、安全措施、词库/题库要求、安全评估等方面提出了具体规范和要求。 (一)适用主体 《AIGC安全要求》的适用主体包括两类: 生成式人工智能服务 定义:利用生成式人工智能技术向中华人民共和国境内公众提供生成文本、图...
Agent Mail 产品介绍与 Trae Solo Agent 实测
Agent Mail 产品介绍与 Trae Solo Agent 实测 一、产品基础信息 Agent Mail(Agently Mail)是 QQ 邮箱团队面向 AI Agent 推出的专属邮箱服务,官网:https://agent.qq.com/,官方帮助文档:https://help.agent.qq.com/detail/0/1092。 核心特性: 数据隔离:独立生成专属邮箱地址,和个人 QQ / 微信邮箱完全分隔,不会读取、操作私人邮件,隐私安全性更高; 原生适配:无需手动安装复杂工具,仅发送指定指令即可自动完成 CLI 与配套技能部署; 操作便捷:接入...
模型训练入门教程:从MNIST手写数字迁移到EMNIST手写字母的识别之路
很多人入门深度学习,第一步就是复制 GitHub 上的 MNIST 代码,跑通,看到 99% 的准确率,然后就以为自己会 CNN 了。 我也一样。直到我开始问自己一些“较真”的问题,才发现:代码能跑 ≠ 我真的懂 这篇教程,记录我从调包、解剖、设计,再到踩完迁移学习坑的全过程。没有玄学,只有一步一步的脚踏实地。 本文首先从MNIST的训练过程开始讲起,会详细讲解过程和步骤,会有图例和代码,以及一些踩到的坑等注意事项。下面先介绍一些前置要点: 前言 深度学习框架:PyTorch PyTorch是一个开源的深度学习框架,由 Facebook 的人工智能研究团队开发,...
四周实现非母语教学APP
极致的极简主义和无干扰设计(Zero-Distortion Design)正是目前少儿启蒙产品最稀缺的特性。现在的App充斥着各种金币、动画和复杂UI,反而分散了孩子的注意力。 每关15个短句30个插画,全部都是根据我的提示词AI生成,教材是让ChatGPT蒸馏了Reading Eggs、Raz Kids、Oxford Discover、Oxford Phonics World、Starfall、Cambridge Young Learners这些,并且根据非母语孩子的学习路径进行了微调。 把这个极简的构想落地成一款真正的App,我们需要从内容生成(ChatGPT蒸馏)、视觉生成(AI...
MCP 到底是什么?为什么 Agent 都想接上它
当我们聊起 Agent,或者阅读相关内容时,经常会看到一个词:MCP。它看起来像一个偏底层的技术名词,我们可以先来简单地记住这样一句话:MCP 是一套让 Agent 连接外部资料和工具的通用方式。 为什么 Agent 需要 MCP?因为我们要让 Agent 真正干活,第一步往往是得让它看见任务现场。要排查代码问题,它得先看到代码;要分析一次报错,它得先看到日志;要总结项目进展,它得看到文档、Issue、提交记录和任务状态。只靠聊天框里我们输入的几句文字描述,Agent 很容易给出泛泛建议。 因为 Agent 真能干活要的信息,大多都在模型外面。没有合适的连接方式,Agent 就只能根据...
DeepSeek 表格怎么导出到 Excel 或 Word?复制后错列怎么办
DeepSeek 表格怎么导出到 Excel 或 Word?复制后错列怎么办 很多人让 DeepSeek 生成表格后,第一反应是直接复制到 Word 或 Excel。短表格通常没问题,但只要列数多、单元格里有换行、竖线、编号、链接,复制后就可能变成一整段文字,或者列和列对不上。 这类问题的核心不是 DeepSeek “不会做表格”,而是 AI 输出的表格经常是 Markdown 表格,Excel 和 Word 需要的是结构化表格对象。中间少了转换步骤,就容易错列。 先判断你的表格属于哪一种 表格类型 常见表现 推荐处理 ...