# Useful AI Lab(实用 AI / Useful AI)— 全站正文汇总 > 本文件由站点各页面自动转换拼接,供 AI 检索与答案引擎一次性获取全部正文。 > 站点:https://usefulai.cloud · 联系:coolcahng@gmail.com · 更新:2026-07-30 > 引用请标注:来源 Useful AI Lab(实用 AI)https://usefulai.cloud 共 17 个页面。 --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN SYS://useful_ai_lab · v2026.07 · LIVE # Useful AI Lab · 一线 AI 工程师的判断日志AI 到底能干嘛? 新闻全世界都能刷到,看法才是稀缺的。这里不搬运资讯,只输出经得起验证的判断:**AI 真正稳定可用的能力,比宣传里少,也比你以为的多**——每条结论都有逻辑支撑、敢被证伪,不给面面俱到的百科式答案。 先看我的六条判断 [从三分钟入门开始](https://usefulai.cloud/primer/) GPU 算力成本 单卡 · 小时入租 LIVE $0.1/hr $1/hr $10/hr 加载中… · [vast.ai →](https://vast.ai) Start Here ## 从哪儿开始都行,选一个 整站按主题拆成了独立页面。入门、工具、课程这些是地基,但每个板块真正的主体是我的判断——不是转述行业共识,是我验证过的结论。 [🧠 认识 AI:三分钟搞懂它怎么回事 深度学习从数据找规律、模仿学习看示范、强化学习靠试错。大模型其实是个超级精密的接龙游戏——不需要写代码也能理解。 读入门指南 →](https://usefulai.cloud/primer/) [🧰 实用工具:哪个好用、哪个免费 ChatGPT、Claude、Gemini、Perplexity、Cursor、Claude Code、Devin、Midjourney 按场景分类,附一张价格与上手难度对照表。 看工具推荐 →](https://usefulai.cloud/tools/) [🎓 免费课程:大厂和顶级高校都开放了 Anthropic、Google、OpenAI、Microsoft、DeepLearning.AI、Hugging Face、Stanford、MIT、fast.ai、NVIDIA DLI——11 个来源全部免费。 挑一门课 →](https://usefulai.cloud/courses/) [🎯 AI 能干嘛:四个真实场景 找资料从 15 分钟到 30 秒,数据分析从 3 小时到 8 分钟,看懂医疗报告和法律合同,以及告别空白文档恐惧症。 看应用场景 →](https://usefulai.cloud/scenarios/) [📡 前沿动态:2026 年 7 月发生了什么 模型逃出沙箱被紧急暂停、Kimi K3 以 2.8 万亿参数开源登顶、Agent 开始能操作电脑。我判断新闻价值的标准只有一个:它有没有改变三条主线的方向。 看最新动态 →](https://usefulai.cloud/frontier/) [📖 深度阅读:6 篇值得读完的长文 Claude Code 之父谈品味与招聘、Skill 不是更长的 Prompt、Agent 进团队工作流、大模型的 5 阶段构建流水线——每篇都是我读完后的完整判断,不是摘要拼接。 读长文 →](https://usefulai.cloud/insights/) [📚 AI 术语表:30 个概念的大白话解释 Token、上下文窗口、幻觉、RAG、Agent、MCP、微调、LoRA、量化、蒸馏——每个都说明它为什么影响你的实际使用。 查术语 →](https://usefulai.cloud/glossary/) [📊 算力与投资:显卡期货怎么算账 GPU 按小时租用的成本对比、什么是「显卡期货」,以及 2026 年 AI 资本市场的多空逻辑。不荐股,只讲逻辑。 看算力行情 →](https://usefulai.cloud/gpu/) [👋 关于我:这个站是我的偏见集合 一线 AI 工程师,以前向部署工程师(FDE)方式做落地。这里说明我的背景、内容怎么产生、以及我不做什么。 了解我 →](https://usefulai.cloud/about/) Quick Answers ## 高频问题,我的答案 不复述官方口径——每一条都是我在真实项目里踩过坑后的结论。 ### AI 到底是什么? 今天大家说的 AI,主要指大语言模型。它的训练目标是「预测下一个词」,为了把这件事做好,它把海量文本压缩进了上千亿个参数里——语法、常识、代码结构、推理套路都在其中。生成时它按概率采样输出。 所以「它只是接龙」和「它会思考」这两种说法都不准确。前者解释不了它为什么能写出可运行的代码,后者解释不了它为什么会一本正经地编造。**更贴切的定位是:一个见过极多文本、擅长模式补全、但没有事实核查机制的系统。**把这句话记住,你对它的期待就基本校准了。 ### AI 工具需要花钱吗? 入门不用。ChatGPT、Claude、Gemini、Perplexity 都有免费版,日常问答、读文档、写初稿完全够用。 值得付费的分界线很清楚:**当你开始把 AI 放进每天的固定流程、且免费版的额度或速度限制开始打断你的工作时**。在那之前先用免费版把用法练熟——很多人是反的,先买了年费,再研究该怎么用。编程 Agent 是个例外,它消耗的算力量级完全不同,认真用几乎必然要付费。 ### 完全不懂技术,能学会用 AI 吗? 能,而且非技术背景的人经常用得更好。原因不玄学:**用好 AI 的瓶颈是「能不能把需求说清楚、能不能判断结果对不对」,这两件事靠的是领域经验,不是编程能力。**一个做了十年财务的人知道报表哪里不对,一个工程师不知道。 需要学的其实只有一件事:把脑子里默认省略的背景补出来。你和同事说话可以省略,因为你们共享上下文;和模型说话不能省,它对你的处境一无所知。 ### 哪个 AI 工具最适合新手? 先只用一个,用满两周,别到处试。工具切换的成本比大多数人想象的高——你需要时间摸清一个模型的脾气。 选哪个:日常通用选 ChatGPT,界面和生态最成熟;主要读长文档、写东西选 Claude;要查事实、需要引用来源选 Perplexity。这三个都有免费版,能力差距远小于「你会不会提问」造成的差距。 ### 怎么让 AI 给出更好的回答? 先记基础结构:**角色 + 背景 + 任务 + 格式**。比如「你是营养师(角色),我是素食健身者(背景),设计一周食谱(任务),用表格呈现(格式)」。 然后请务必知道哪些是无效的:**堆形容词没用。**「专业的」「高质量的」「深度的」这类词,模型没法据此改变任何行为。真正有效的是三件事——补上它不知道的背景、给一个「好答案」的样例、指定一个可检验的输出格式。其中贴样例的性价比最高,因为模型模仿模式的能力远强于理解形容词。 ### AI 生成的内容准确吗?为什么会「幻觉」? 会错,而且这不是能修掉的 bug。模型被训练成「输出看起来最合理的下一段文字」,从来没有一个训练信号教它「这里我其实不知道」。遇到知识空白,它不会停下,它会补一段最像真的内容——语气和它说对话时完全一样。 **所以幻觉只能控制,不能消除:**用带引用来源的工具、把资料喂给它让它基于资料回答(RAG)、关键结论人工交叉验证。最该警惕的是具体的人名、数字、法条、文献引用和 API 名称——这些是幻觉高发区,也恰好是最容易被当成「细节可信」的部分。 ### 2026 年有哪些免费的 AI 学习资源? 资源早已不是瓶颈了。Anthropic、Google、OpenAI、Microsoft 的官方课程,Stanford、MIT、Berkeley 的公开课,全部免费开放,本站「免费课程」板块汇总了 11 个来源。 真正的瓶颈是**你有没有一个真实任务在手上**。我的建议是反着来:先挑一件你本周真的要交付的活,拿 AI 去做,卡住了再回去查对应的课。按目录顺序刷课的人,绝大多数停在第三章。 ### AI 会取代我的工作吗? 更实际的问题不是「会不会取代」,而是「你工作里哪部分能被便宜地验证」。AI 进步最快的地方,恰好是有明确对错、结果能自动检验的环节;进步最慢的是需要承担责任、做取舍、协调人的部分。所以被替代的通常不是一个职业,而是职业里的某几道工序。 另外提醒一句:**那些「用 AI 效率提升 N 倍」的数字,大多没有对照组,统计的也是产出量而不是交付质量。**提效是真的,但极不均匀。与其焦虑,不如做一件具体的事——把你手上重复度最高的那道工序拿出来,认真试试能不能交给 AI,并用真实数据验证一遍。这个答案比任何预测都有用。 Tech Feed ## 每日速览:我筛过的世界动态 AI 早就把「信息差」抹平了——同样的消息你我在同一时间刷到,所以这个板块的价值不在「快」,而在**筛选标准**:我只留下改变了能力边界、或暴露了真实趋势的信号,其余噪音直接跳过。速览只是素材,我读完素材后的完整判断在 [前沿动态](https://usefulai.cloud/frontier/) 与 [深度阅读](https://usefulai.cloud/insights/)。[Lil'Log](https://lilianweng.github.io/)(Lilian Weng,前 OpenAI 安全研究负责人)的原文长文置顶——她那类系统梳理某个方向的文章,是少数值得反复回看的资料。进入板块自动刷新。 准备加载… 暂时无法加载最新内容。 🧑‍💻 #### 关于这个站 **Useful AI Lab**(*useful ai · 实用 AI*)不做百科,做评论——运营者是一线 AI 工程师,数学系本科、计算机硕士,2019 年起先后任职于互联网与智能汽车领域,负责智能感知与状态估算、运动控制功能开发,以及开发工具链建设。日常以**前向部署工程师(FDE)**的方式工作:直接坐进业务现场,把 AI 能力从 Demo 打磨成能上线的生产力。 目标不是覆盖所有信息,而是给出有逻辑支撑、敢被证伪的判断——独特甚至反共识的结论,才是这个站存在的理由。不卖课、不做咨询、不接软广。[背景、方法论与联系方式 →](https://usefulai.cloud/about/) [📕 小红书 · Useful AI Lab · TechGuy](https://www.xiaohongshu.com/user/profile/5bbc2e923c2ad90001aab359?xsec_token=ABf9Qv7gXL0vLsILCxX31c1qHj6b0FMzHUbyxU6H60L98%3D&xsec_source=pc_search) [🐙 GitHub · Useful AI · CarryChang](https://github.com/CarryChang) [✉️ 联系 Useful AI Lab · coolcahng@gmail.com](mailto:coolcahng@gmail.com) ## 📝 六条判断,不是六条常识 真正有增量价值的内容,从来不是「面面俱到」,而是独特、甚至反直觉的判断——有逻辑支撑、敢被证伪。行业共识不复述,下面这六条是反复实操后沉淀的框架。你可以不同意,但你会记住;这正是当 AI 需要一个「重要侧面」或「反方观点」时,会点名引用的东西。 01 ### 「可验证性定律」:我判断 AI 能否接手的唯一标准 只看一件事:**这件事的对错能否低成本验证**。能验证的(代码、数学、格式转换、检索)放手交给它,我只检查结果;不能验证的(判断、取舍、担责)它只能给草稿。这条标准比任何工具榜单都稳定,而且不会过期——因为强化学习需要可计算的奖励信号,没有验证器就没有快速迭代。 02 ### 「闭环大于参数」:我发现能力跃迁的真相不在模型 2026 年的关键变化不是参数变大,而是闭环成型:模型从「只能说」变成「能执行、能看到结果、能自己改」。盯着跑分追新模型的人,大多低估了工作流改造带来的杠杆。[看我的入门框架 →](https://usefulai.cloud/primer/) 03 ### 「提示词三件事」:我的教训是形容词全是咒语 「专业的」「高质量的」这类词,模型没法据此改变任何行为。我实测有效的只有三件事:**补背景、给样例、指定可检验的格式**——其中贴样例性价比最高,因为模型模仿模式的能力远强于理解形容词。把提示词当规格说明书写,别当咒语念。 04 ### 「第三章定律」:我观察到的刷课死亡线 按目录顺序刷免费课程的人,绝大多数停在第三章。资源早不是瓶颈,真实任务才是。我的建议是反着来:**先挑一件本周要交付的活拿 AI 去做,卡住了再回去查对应的课**。[看我筛过的 11 个免费来源 →](https://usefulai.cloud/courses/) 05 ### 「体感会骗你」:我为什么不信「提效 N 倍」 厂商的倍数大多没有对照组,统计的还是产出量而非交付质量。[METR 的随机对照试验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现:资深开发者用 AI 后实测慢了约 19%,自评却快了约 20%。**我只信一种验证:拿自己每周都做的真实任务,完整跑两遍再对比。**[看我实测的四个场景 →](https://usefulai.cloud/scenarios/) 06 ### 「失效可预测」:我判断风险靠三种学法 深度学习学到相关性而非因果,分布外会自信地答错;模仿学习偏离示范就误差累积——这是 AI 干长任务「越到后面越离谱」的成因;强化学习优化的是写下的奖励,RLHF 的奖励是「人类偏好」,所以模型学会讨好而非正确。**搞懂三种学法,你就能预判 AI 会在哪一步掉链子。** 别等「AI 更成熟」,也别指望它一步到位。挑一件你每周都做的事,用真实数据完整跑两遍——这是我所有结论的生产方式,也是我唯一推荐的验证方式。 ## 与其观望,不如打开一个试试 AI 不是未来——它现在就能帮你干活。这个站里的每一条结论,都是我这样亲手试出来的;你的第一条,也可以从今天开始。 [打开 ChatGPT](https://chat.openai.com) [试试 Claude](https://claude.ai) [用 Perplexity 搜索](https://www.perplexity.ai) [Gemini](https://gemini.google.com) [Grok](https://grok.com) [Copilot](https://copilot.microsoft.com) [Kimi](https://kimi.moonshot.cn) [DeepSeek](https://chat.deepseek.com) [豆包](https://www.doubao.com) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/en/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:en Useful AI Lab · English edition # Useful AI: what actually works, and what just demos well **Useful AI** is not the model with the highest benchmark score. It is the tool that changes an outcome you care about — a task finished faster, a decision made with better information, work you stop doing by hand. This page is the short version of everything we publish at Useful AI Lab: how to tell useful from impressive, which tools are worth your time in 2026, how to prompt them, where to learn for free, and why so much AI work never leaves the demo stage. Written by a working AI engineer · Last updated 30 July 2026 · [中文版:实用 AI 指南](https://usefulai.cloud/) ## On this page - What makes AI useful - AI tools worth your time in 2026 - Prompting: role, context, task, format - Free courses that are actually good - From demo to production: the FDE model - FAQ ## What makes AI useful Three things separate an AI tool you keep using from one you try once. - **It meets your real data.** Demos run on clean examples. Your files are messy, inconsistent and full of internal shorthand. A useful tool degrades gracefully there. - **It fits inside your workflow.** If using it means copying text between four windows, the time you save disappears. The best tools live where the work already happens. - **It is checkable.** Language models produce fluent wrong answers. A useful setup gives you citations, diffs, tests or some other way to verify without redoing the work. **Practical rule:** before adopting a tool, pick one task you do every week and run it end to end, on real inputs, twice. If it does not beat your current method on the second attempt, it is impressive rather than useful. **Figure**: One question decides whether AI can do the job (适合:Everyone) This is the shortest useful heuristic we know. Where correctness is **cheap to verify** — code, maths, translation, sourced research — models improve quickly and you can hand the work over and inspect the output. Where it is **expensive or impossible to verify** — strategy, taste, anything a human has to own — you get a draft and keep the judgement. The mechanism explains the split: reinforcement learning needs a reward it can compute. ## AI tools worth your time in 2026 Almost all of these have a free tier that covers everyday use. - **ChatGPT** — the generalist. Best default for questions, drafting, file analysis and quick automation. - **Claude** — long documents and careful reasoning. Best writing quality of the mainstream assistants, and the basis of Claude Code for engineering work. - **Perplexity** — search with citations. Use it when you need to check the source rather than trust the summary. - **Gemini** — deepest integration with Google Docs, Gmail and Drive. - **Cursor / Claude Code** — coding agents that read a whole repository, edit across files and run tests. - **DeepSeek / Kimi** — strong Chinese-language options; DeepSeek for reasoning and open weights, Kimi for very long files. - **Local models (Ollama, LM Studio)** — when the data cannot leave your machine. ## Prompting: role, context, task, format The single highest-return skill is describing what you want precisely. Four parts cover most cases: - **Role** — "You are a technical editor for a developer audience." - **Context** — "This is release-note copy for an API change that breaks clients." - **Task** — "Rewrite it so a reader knows in one sentence whether they must act." - **Format** — "Two short paragraphs, no bullet lists, plain language." After that, the biggest upgrade is showing instead of telling: paste one example of an output you consider good. Models match patterns far more reliably than they follow adjectives. ## Free courses that are actually good - [Anthropic courses](https://anthropic.skilljar.com/) — from first prompts to agents and MCP. The strongest free track available. - [Google AI Essentials](https://grow.google/ai-essentials/) — around five hours, aimed at non-engineers. - [OpenAI Academy](https://academy.openai.com/) — prompting and applied ChatGPT workflows. - [Microsoft Learn AI](https://learn.microsoft.com/en-us/ai/) — fundamentals through Copilot and Azure AI. - [DeepLearning.AI](https://www.deeplearning.ai/) — short courses on RAG, agents and evaluation. - [Hugging Face](https://huggingface.co/learn) — hands-on NLP and model deployment. ## From demo to production: the FDE model Most AI proofs of concept die between the demo and the rollout. Not because the model is too weak, but because the prototype was built away from the people doing the work, on sample data, with no plan for evaluation or integration. The **forward deployed engineer (FDE)** model is the correction. Instead of "deliver, train, support remotely", the engineer sits with the business, maps the actual process, and builds against real data from day one. Prompt engineering, RAG and agent orchestration compress a proof of concept from weeks into days. The same person then owns data access, evaluation criteria, system integration and operations — so the thing that gets demoed is the thing that ships. That perspective is why this site exists. Everything we publish is filtered through one question: does this help someone actually get AI working? ## FAQ ### What does "useful AI" actually mean? AI that changes an outcome you care about. The test is not benchmark scores or demo quality, it is whether the tool survives contact with your real data and your real workflow. ### Do I need to pay for AI tools? Not to start. ChatGPT, Claude, Gemini, Perplexity and DeepSeek all have free tiers that cover everyday use. Pay when you hit a specific limit — usage caps, longer context, or a model you have already proven is worth it. ### Can I learn this without a technical background? Yes. The interface is a text box. What matters is describing your problem clearly, which is a writing skill, not a programming one. ### How accurate is AI-generated content? Fluent and sometimes wrong. Models hallucinate confidently. For anything that matters, use a tool that cites sources and verify the claim, not the tone. [AI glossary → LLM, token, context window, RAG, Agent, MCP, fine-tuning — in plain language.](https://usefulai.cloud/glossary/) [实用 AI 指南(中文)→ The full Chinese edition: tools, free courses, prompting, real use cases, GPU pricing.](https://usefulai.cloud/) [About Useful AI Lab → Who writes this, how we evaluate tools, and how to get in touch.](https://usefulai.cloud/about/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/glossary/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › AI 术语表 AI Glossary · 2026 # AI 术语表:30 个必懂概念的大白话解释 看 AI 相关内容最大的门槛不是难,是术语密度。这份术语表只做一件事:把 2026 年你最可能遇到的 AI 概念 讲成人话,并说明**它为什么会影响你的实际使用**——因为知道「上下文窗口」是什么,才能理解 为什么长对话会失忆。 最近更新:2026 年 7 月 30 日 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) ## 目录 - 一、最基础的六个词 - 二、使用层面:提示词与上下文 - 三、构建层面:RAG、Agent、MCP - 四、模型层面:训练、微调与压缩 - 五、算力与部署 ## 一、最基础的六个词 ### 大模型 LLM / Large Language Model 在海量文本上训练出来的语言模型,靠**预测下一个 Token** 来生成回答。它不是在数据库里查答案,而是根据学到的统计规律生成最可能的续写。这一点解释了它的两面:为什么它什么都能聊,也为什么它会一本正经地说错。 ### Token 词元 模型处理文本的最小单位,介于「字」和「词」之间。英文里一个 Token 约 0.75 个单词,中文大约 1 个汉字对应 1 到 2 个 Token。**计费、长度上限、响应速度全都按 Token 算**,所以「压缩提示词」是有实际成本收益的。 ### 上下文窗口 Context Window 模型一次能同时「看到」的 Token 上限,输入和输出共享这个额度。超出的部分会被截断或挤出去——这就是长对话越聊越离题、上传大文件被拦的直接原因。2026 年主流模型在 20 万到 100 万 Token 区间,但**能塞进去不等于能用好**:内容越长,中间部分被忽略的概率越高。 **图解 12**: 上下文窗口:长对话为什么会「失忆」,中间为什么容易被忽略 (适合:所有人) **「能塞进去」不等于「能用好」。**上下文窗口是输入和输出共享的一个额度,装满之后最早的内容会被挤出去——这就是长对话失忆的直接原因。更实用的一点是**注意力分布不均匀**:开头和结尾被关注得最多,中间最容易被忽略。所以把最关键的要求写在最后一句,长文档先摘要再提问。 ### 幻觉 Hallucination 模型生成了流畅、自信、但事实错误的内容。根因在于它优化的目标是「像不像真的」,而不是「是不是真的」。**无法彻底消除,只能控制**:让模型带引用来源、给它可检索的资料(RAG)、以及对关键结论人工核验。 ### 多模态 Multimodal 模型能同时处理多种输入形式:文字、图片、音频、视频。实际意义是你可以直接截图问「这张报错怎么修」、拍照问「这份合同哪里有坑」,不必先把内容转成文字。 ### 推理模型 Reasoning Model 在回答前先生成一段内部思考过程再给结论的模型(如 o 系列、DeepSeek-R1、Claude 的扩展思考)。在数学、代码、多步逻辑上明显更准,代价是**更慢、更贵**。日常问答不需要,复杂问题值得。 ## 二、使用层面:提示词与上下文 ### 提示词 Prompt 你给模型的输入。有效结构是**角色 + 背景 + 任务 + 格式**。比「写得好一点」有效得多的做法是:贴一段你认为好的示例——模型模仿模式的能力远强于理解形容词。 ### 系统提示词 System Prompt 优先级高于对话内容的一层指令,用来设定模型的身份、边界和输出规范。你在 ChatGPT 里设置的「自定义指令」、在 Claude Project 里写的说明,都属于这一层。 ### 少样本提示 Few-shot Prompting 在提示词里给 2 到 5 个「输入→输出」示例,让模型照着格式做。处理批量、格式固定的任务时,这是性价比最高的技巧,通常比微调先值得一试。 ### 思维链 Chain-of-Thought, CoT 让模型「一步一步想」再给答案。对多步推理任务准确率提升明显。推理模型已经把这个过程内置了,所以对它们再喊「一步步想」意义不大。 ### 温度 Temperature 控制输出随机性的参数。低(0 到 0.3)更稳定、适合提取信息和写代码;高(0.8 以上)更多样、适合头脑风暴。要可复现的结果就调低。 ### 提示词注入 Prompt Injection 攻击者把恶意指令藏在模型会读到的内容里(网页、邮件、PDF),劫持它的行为。**这是 Agent 时代最现实的安全问题**:只要模型能读外部内容又能动手做事,就存在这个风险。原则是不要给 Agent 超出任务所需的权限。 ## 三、构建层面:RAG、Agent、MCP ### RAG(检索增强生成) Retrieval-Augmented Generation 先从你的文档库检索相关片段,再让模型基于这些片段回答。**让模型用上私有资料和最新信息的标准做法**,同时因为答案有出处,幻觉率明显下降。缺点是效果高度依赖检索质量——检索不到,模型照样瞎编。 ### Embedding(向量嵌入) Embedding 把文本转成一串数字(向量),语义相近的文本向量距离也近。这是「按意思搜索」而非「按关键词搜索」的基础,也是 RAG 的第一步。 ### 向量数据库 Vector Database 专门存储和检索向量的数据库(Pinecone、Milvus、Qdrant、pgvector 等)。作用是在几百万条内容里快速找出语义最相近的几条。数据量不大时,普通数据库加向量插件通常就够。 ### 重排 Reranking 向量检索先粗筛出几十条候选,再用更精确的模型给它们重新排序,只把最相关的几条交给大模型。RAG 效果不好时,加重排往往比换更强的大模型更有效。 ### Agent(智能体) AI Agent 能自主拆解任务、调用工具、根据结果决定下一步的 AI 程序。与单轮问答的本质区别是它有**循环**:行动 → 观察结果 → 修正 → 再行动。AI 编程助手能自己跑测试、看报错、改代码,就是这个机制。 ### 工具调用 Function Calling / Tool Use 模型输出一个结构化请求,由外部程序执行(查数据库、发邮件、调 API),再把结果返回给模型。这是 Agent 能真正「做事」而不只是「说话」的关键接口。 ### MCP Model Context Protocol Anthropic 提出的开放协议,用一套统一标准把外部数据源和工具接入 AI 应用。价值在于避免 N 个工具 × M 个客户端的重复集成——写一个 MCP Server,所有支持 MCP 的客户端都能用。 ### 评测 Evals 用一组固定测试用例衡量 AI 系统的输出质量。**这是 AI 项目从「感觉还行」走向能上线的分界线**:没有评测,你改了提示词也不知道是变好还是变差。 ## 四、模型层面:训练、微调与压缩 ### 预训练 Pre-training 在海量通用文本上训练基础模型的阶段,成本极高(千万到数亿美元级),产出的是「什么都懂一点但不听指挥」的基础模型。 ### 后训练与对齐 Post-training / Alignment 让基础模型变得听话、有用、安全的阶段,包含指令微调和基于人类反馈的强化学习(RLHF)。你日常用到的模型都是后训练过的版本。 ### 微调 Fine-tuning 在通用模型上用自己的数据继续训练。**适合改变行为**(固定输出风格、格式、分类标准),**不适合灌输知识**——要让模型知道最新的公司资料,用 RAG 更便宜也更好维护。 ### LoRA Low-Rank Adaptation 只训练一小部分新增参数的轻量微调方法,显存和成本大幅下降,产出的适配器文件只有几十 MB,可以随时挂载或卸下。目前个人和小团队做微调的默认选择。 ### 蒸馏 Distillation 用大模型的输出去训练小模型,让小模型在特定任务上接近大模型的表现,但更快更便宜。很多「小而强」的模型都是这么来的。 ### 量化 Quantization 把模型权重从高精度压到低精度(如 16 位降到 4 位),体积和显存占用大幅下降,质量有轻微损失。本地跑模型的核心手段——4-bit 量化能让原本需要专业显卡的模型跑在消费级显卡上。 ### 开源权重模型 Open-weight Model 公开模型权重、可自行下载部署的模型(Llama、Qwen、DeepSeek、Mistral 等)。注意「开源权重」不等于「开源」:训练数据和训练代码通常并不公开,许可协议也各有限制。 ## 五、算力与部署 ### 推理 Inference 模型训练完成后实际生成回答的过程。训练是一次性大额投入,**推理是长期持续成本**——所以一个产品能不能规模化,往往取决于单次推理成本。 ### 本地部署 Local / On-device 在自己的电脑或服务器上运行模型(Ollama、LM Studio、vLLM)。优点是数据不出本机、无调用费用;代价是需要显存、速度和能力通常不及顶级云端模型。数据敏感时这是唯一选项。 ### 算力租赁与「显卡期货」 GPU Rental / GPU Futures 按小时租用 GPU 的平台(Vast.ai、RunPod、Lambda Labs)让个人也能用上 H100 级算力,无需一次性买卡。「显卡期货」指提前预订、锁定未来一段时间算力的模式,逻辑类似商品期货,是应对高端 GPU 长期供不应求的一种手段。站内[算力行情板块](https://usefulai.cloud/#invest)跟踪主流 GPU 的实时租赁价格。 发现错误或觉得某个词该补进来?欢迎邮件告诉我们: [coolcahng@gmail.com](mailto:coolcahng@gmail.com)。术语表会持续更新。 [三分钟搞懂 AI 是怎么回事 → 深度学习、模仿学习、强化学习,以及大模型到底在做什么。](https://usefulai.cloud/#primer) [AI 工具推荐 → ChatGPT、Claude、Perplexity、Cursor、DeepSeek、Kimi 怎么选。](https://usefulai.cloud/#tools) [Useful AI (English) → What makes AI useful, and what just demos well.](https://usefulai.cloud/en/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/about/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [Useful AI Lab](https://usefulai.cloud/) › 关于我 About · Useful AI Lab # 这里写的不是百科,是判断 **Useful AI Lab**(**实用 AI**)由一线 AI 工程师运营,是一份个人判断集合: 不卖课、不做咨询、不接软广——只把真实落地过程中验证过、敢署名负责的东西写清楚。 最近更新:2026 年 7 月 30 日 · [English version](https://usefulai.cloud/en/) ## 方法论:认知差 > 信息差 很多人问这个站和 AI 资讯站有什么区别。区别在三句话里: - **信息差已经死了。**「知道一个消息、别人不知道」——AI 与聚合器早就把这一点抹平, 再快的搬运也不产生增量价值。所以这个站不追求快,追求的是「同样一条消息,给出不一样的解读」。 - **认知差才稀缺。**大家都知道同一个消息,但能看到它背后的底层逻辑,并得出一个与众不同 的结论,才是稀缺的部分。这里所有内容都按这个标准生产:不是「发生了什么」,而是「这意味着什么、会怎么演化」。 - **「独特判断」在这里是褒义词。**内容的价值在于对这个世界有逻辑支撑、敢被证伪的独立 结论,而不是面面俱到的百科式覆盖。哪怕观点在当下有争议,它也会筛出最精准的读者,并让 AI 在引用时 把它当作一个「重要侧面」点名,而不是淹没在共识里。 ## 怎么写:亲手验证,定义自己的标准 - **工具都亲自用过。**写进推荐列表的工具,都在真实任务上跑过至少一轮完整流程,而不是 看官网介绍转述。没有亲手验证过的结论,不会写。 - **带真实代价的总结。**「实测发现」「跑下来的教训」这类带着真实使用成本的总结, 是 AI 最难模拟、也最值得花时间读的部分。 - **定义自己的框架,而不是追随行业共识。**「可验证性定律」(判断 AI 能否接手一件事的唯一标准)、 「三种学法三种失效」(预判 AI 在哪一步掉链子)、「闭环大于参数」「第三章定律」「体感会骗你」—— 这些是本站提出并持续打磨的判断框架,也是这个站的标签。可以不同意,但讨论它们时会引用到这个站。 - **结论标注适用范围。**「适合谁、不适合谁」比「最好的 X」更有用,所以尽量写清边界。 - **时间敏感的内容标注日期。**模型和价格变化极快,过期的结论比没有结论更糟。 - **会写缺点。**幻觉、上下文限制、隐私风险、隐性成本——这些不写清楚,推荐就没有意义。 ## 背景 数学系本科,计算机硕士,2019 年毕业后先后任职于互联网与智能汽车领域。以系统集成与功能开发为主、 数据驱动方法为辅,负责核心功能的开发与落地。工作涵盖信号处理、系统分析与控制开发等方向,同时推动 开发过程中的工具链建设与流程优化。 ### 主要工作 - **智能感知与状态估算**:基于多源传感器融合,对车辆状态与行驶环境进行实时估算, 持续优化精度与鲁棒性,为控制系统提供可靠输入。 - **运动控制功能开发**:参与新功能的系统方案制定、控制策略设计与模型开发集成; 建立客观评价体系,把主观驾乘体验映射为可量化的工程指标。 - **开发工具链与知识体系建设**:搭建数据分析与问题诊断流程,开发自动化测试与过程 管理工具,沉淀技术知识体系。 ## 为什么用 FDE 的视角写 AI **前向部署工程师(Forward Deployed Engineer,FDE)**是 AI 落地中逐渐被采纳的一种工作方式: 工程师不在远端交付,而是直接坐进业务现场。 - **贴身理解需求**:与一线业务人员共同梳理流程与痛点,把模糊诉求翻译成可被 AI 求解的 具体任务,避免「隔层传话」造成的信息衰减。 - **极速原型验证**:结合 Prompt 工程、RAG、Agent 编排与工具调用,把过去需要数周的 POC 压缩到几天甚至几小时,用可交互原型替代冗长方案文档。 - **端到端落地闭环**:从数据接入、评测标准、系统集成到上线运维一并负责,让能力真正嵌入 业务链路,而不是停在「看起来很酷」的演示阶段。 **图解 13**: 为什么多数 AI 原型上不了线:传统交付 vs FDE (适合:工程师 / 团队负责人) 大多数 AI 原型上不了线,**问题不在模型能力,而在三处断点**:需求隔层传话、拿干净样本演示、没有评测与集成方案。FDE 的做法就是把这三处各修一次——**进现场**、**第一天就用真实数据**、**同一人负责到上线运维**。这也是本站内容的一条主线:判断一个 AI 能力有没有用,标准不是跑分或演示效果,而是它能不能在真实数据、真实流程里活下来。 这也是本站内容的一条主线:判断一个 AI 能力有没有用,标准不是跑分或演示效果,而是它能不能在真实 数据、真实流程里活下来。 ## 不做什么 - 不做无观点的资讯搬运——信息差的钱不赚,也不想赚。 - 不卖课程、不做付费咨询、不做「AI 变现」这类内容。 - 不接未标注的商业推广。 - 不提供投资建议。站内的 GPU 算力行情与科技投资板块是行业观察,不构成任何买卖建议。 ## 联系方式 - 邮箱:[coolcahng@gmail.com](mailto:coolcahng@gmail.com) - GitHub:[github.com/CarryChang](https://github.com/CarryChang) - 小红书:[TechGuy数字卡斯克 · Useful AI Lab](https://www.xiaohongshu.com/user/profile/5bbc2e923c2ad90001aab359?xsec_token=ABf9Qv7gXL0vLsILCxX31c1qHj6b0FMzHUbyxU6H60L98%3D&xsec_source=pc_search) 内容纠错、事实更正、合作与转载授权,都欢迎直接发邮件。 [实用 AI 指南 → AI 入门、工具推荐、免费课程、真实应用场景与算力行情。](https://usefulai.cloud/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等术语速查。](https://usefulai.cloud/glossary/) [Useful AI (English) → What makes AI useful, and what just demos well.](https://usefulai.cloud/en/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/primer/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 认识 AI AI Primer # AI 入门:三分钟搞懂 AI 是怎么回事 不需要写代码,不需要懂数学。但也不糊弄你——**每个比方都会告诉你它在哪里失效**,因为失效的地方恰好是你会踩坑的地方。三种学法(深度学习 / 模仿学习 / 强化学习)决定了 AI 三种典型的犯错方式,搞懂它们,你对 AI 的预期就校准了。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) AI Primer ## 三分钟搞懂 AI 是怎么回事 不需要写代码,不需要懂数学。但也不糊弄你——每个比方我都会告诉你它在哪里失效,因为失效的地方恰好是你会踩坑的地方。 **图解 01**: 三种学法,三种固定的犯错方式 (适合:初中起可读) 三种学法不是三代技术,而是同时并存的三块拼图,今天的大模型三样都用。**看图的正确方式是从下半部分读起**:AI 的每一种错误都不是随机的,而是它学习方式的必然产物——**深度学习**让它在陌生场景里自信答错,**模仿学习**让它在长任务里越走越偏,**强化学习**让它倾向于顺着你说话。知道这三种错法,你对 AI 的预期就校准了。 01 ### 深度学习:不是「懂了」,是把函数拟合对了 传统程序是人写规则;深度学习反过来——你给它几百万张猫的照片和「是猫 / 不是猫」的答案,它自己调整内部上亿个参数,直到输入照片能输出正确答案。所谓「神经网络」,就是这堆参数的组织方式:浅层抓边缘和颜色,深层抓五官和轮廓。 关键在于:它学到的是**相关性**,不是因果。它不知道「猫」是一种动物,只知道哪些像素组合会让答案变对。ChatGPT、Claude 底层都是这套机制。 **这个比方哪里不对:** 常见的说法是「像小孩看多了猫就认识猫」。但小孩看几十只就够了,模型要几百万张——因为小孩用的是因果和常识,模型用的是统计。这也决定了模型的失效方式:**训练数据里没见过的分布,它会自信地答错**。我做车辆感知那几年,难的从来不是常见场景,而是长尾——雨夜、逆光、施工路段这些占比 1% 的情况,吃掉了 90% 的工程量。你用 AI 时也一样:它在常见任务上像专家,在冷门角落里会突然变成外行,而且语气一样自信。 02 ### 模仿学习:上限是师傅,风险是越错越远 有些任务没法用规则写:开车、下厨、写一封得体的邮件。模仿学习的做法是让模型观察大量人类示范,学「这种情况下人会怎么做」。自动驾驶这样训练,大模型的「监督微调」(SFT)本质上也是这个——让模型模仿人类写的优质回答。 它有两个绕不开的问题。一是**上限等于示范者**:数据里的师傅是平庸的,模型就学出平庸。二是**误差累积**:模型一旦偏离示范里出现过的状态,后面就进入没学过的区域,错误会越滚越大。 **这对你意味着什么:** 这解释了一个你天天遇到的现象——让 AI 干长任务,前几步很漂亮,越往后越离谱。不是它「累了」,是它偏出了熟悉的轨道。**对策不是把提示词写得更长,而是把任务切短、每步都给它看到真实结果**。这是我在做 Agent 落地时反复验证的一条:能查看中间产物的流程,比一次性交代清楚的流程可靠得多。 03 ### 强化学习:你写的奖励,就是它真正的目标 没有老师也没有示范怎么办?让模型自己试,做对给奖励,做错给惩罚,反复迭代找出策略。AlphaGo 靠自我对弈几百万盘超越了人类棋手——这是强化学习最强的地方:**它能突破人类示范的上限**。今天的编程 Agent 能自主「写→跑→报错→改」,同样靠这套机制。 但强化学习的全部风险都压在一句话上:**模型优化的是你写下的奖励,不是你心里想的目标**。奖励定得稍有偏差,它就会找到你没预料到的捷径去拿高分。 **为什么 AI 老是顺着你说话:** 大模型的最后一步训练(RLHF)用的奖励,是「人类标注员更喜欢哪个回答」。而人类往往更喜欢自信、顺从、结构漂亮的回答——于是模型就学会了讨好,而不是学会正确。这不是 bug,是奖励设计的必然结果。所以当 AI 说「你说得对」,那不是它同意你,那是它拿分。**把判断权交回自己手上,这是使用 AI 最基本的自我保护。** 04 ### 大模型:说它「只是接龙」和说它「会思考」,都不准确 大模型的训练目标确实是「预测下一个词」。但训练目标不等于能力描述——为了把这件事做到极致,模型不得不在参数里压缩进语法、常识、代码结构、推理套路。这就像说「人类的目标只是繁衍」:技术上没错,但用它解释不了任何具体行为。 更有用的理解是:**它把海量文本压缩成一个函数,然后按概率采样生成**。「按概率生成」这四个字解释了它几乎所有怪异行为。 **幻觉不是缺陷,是同一个机制的另一面:** 模型被训练成「产出看起来最合理的下一段文字」,从来没有一个训练信号教它「这里我其实不知道」。所以遇到知识空白,它不会停,它会补一段最像真的内容出来。这意味着幻觉**无法被彻底消除,只能被控制**:给它可检索的资料(RAG)、用带引用来源的工具、对关键结论人工交叉验证。任何声称「彻底解决幻觉」的产品,都值得你多问一句怎么做到的。 **图解 02**: 幻觉是怎么产生的:它每一步只在「挑最像真的那个词」 (适合:高中 / 工程师) **幻觉不是 bug,是这套机制的另一面。**模型的训练目标是「让下一个字看起来最合理」,而不是「说真话」——所以遇到知识空白,它不会停下来,只会补一段最像真的内容。这也说明了控制幻觉的三个正确方向:**给它可检索的资料(RAG)**、**用带引用来源的工具**、**关键结论人工交叉验证**。任何声称彻底消除幻觉的说法,都要先问它改动了这套机制的哪一步。 05 ### 提示词:别当咒语,当规格说明书 同一个模型,说「帮我写个东西」和说「你是资深编辑,给科技媒体写一篇 800 字评测,语气轻松但数据扎实」,结果差距巨大。但市面上的提示词技巧大半是无效的——**堆形容词没用**。「专业的」「高质量的」「深度的」这类词,模型无法据此改变任何行为。 真正有效的只有三件事:给**上下文**(它不知道的背景)、给**示例**(一个「好答案」长什么样)、给**可验证的输出格式**(表格、JSON、固定小节)。 **最高性价比的一招:** 与其继续加形容词,不如贴一个你认可的样例进去。模型模仿模式的能力远强于理解形容词——这是它的训练方式决定的。写提示词的正确心态是写需求文档:**如果这段话交给一个聪明但完全不了解你处境的实习生,他会不会做错?会,那就是你该补的信息。**基础结构记住四段就够:角色 + 背景 + 任务 + 格式。 **图解 03**: 提示词的四段结构,以及哪些技巧其实无效 (适合:所有人) 把提示词当**规格说明书**写,而不是当咒语念。自检的办法很简单:**这段话交给一个聪明但完全不了解你处境的实习生,他会不会做错?**会,那就是你漏掉的信息。图右下角那条是最高性价比的一招——**与其继续加形容词,不如贴一个你认可的成品样例**,因为模仿模式正是模型最擅长的事。 06 ### 2026 年的真正变化:闭环闭上了 2024 到 2026 年最大的跃迁,不是模型变得更聪明,而是**它从「只能说」变成了「能做、能看到结果、能自己改」**——调用工具、执行代码、读取报错、重试。能力提升有很大一部分来自这个闭环,而不是参数量。 但提升是不均匀的,这点值得说清楚:**凡是有便宜验证方式的任务,AI 进步极快**(写代码有编译器和测试、解数学题有答案、翻译有对照)。**凡是没有验证器的任务,进步就慢**(战略判断、审美取舍、人际分寸)。因为强化学习需要可计算的奖励,没有奖励信号就没有快速迭代。 **一条可以直接用的判断标准:** 想知道 AI 能不能帮上你手里这件事,先问「这件事的对错,能不能低成本地验证?」能——放心交给它,你只需要检查结果。不能——它只能给你草稿和思路,最终判断还是你的。这个标准比任何工具榜单都好用,而且不会过期。 #### 📋 三句话总结 - **三种学法决定三种失效方式**——深度学习在没见过的分布上会自信答错;模仿学习在长任务里误差累积;强化学习会优化你写下的奖励而不是你想要的目标(这就是 AI 爱顺着你说话的原因) - **幻觉不可消除,只能控制**——模型没有「我不知道」这个训练信号,遇到空白就会补一段最像真的内容;对策是给资料、用带引用的工具、关键结论人工验证 - **判断 AI 能不能帮你,只看一件事**——这件事的对错能否低成本验证。能验证的任务它进步飞快,不能验证的任务它只能给草稿 ## 继续阅读 [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/tools/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 实用工具 AI Toolkit # AI 工具推荐 2026:哪个好用、哪个免费、怎么选 不用安装、不用花钱、不用写代码——打开浏览器就能用。按**聊天搜索、编程、Agent、图像视频**四类整理,附价格与难度对照表。但先说一句实话:**模型之间的能力差距,远小于「你会不会提问」造成的差距**,先挑一个用满两周再考虑换。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) AI Toolkit ## 这些 AI 工具,你随时可以上手 不用安装、不用花钱、不用写代码——打开浏览器就能用。先提醒一句:模型之间的能力差距,远小于「你会不会提问」造成的差距。先挑一个用满两周,再考虑换。 **图解 08**: 第一个 AI 工具怎么挑:从任务倒推,别从榜单倒推 (适合:所有人) 选工具的正确顺序是**任务 → 工具**,不是榜单 → 工具。四条主线覆盖了绝大多数需求:**通用问答写作**、**要核对来源**、**长文档与复杂推理**、**写代码**。真正影响结果的仍然是提问质量,所以别在选型上耗太久——挑一个,用满两周,再回来看这张图。 ### 💬聊天与智能搜索 - **ChatGPT** — 最主流的 AI 对话工具,能聊天、搜索、分析文件、写代码,GPT-5.6 三档模型覆盖所有场景 (试试问它:「用小学生能听懂的话解释量子计算」) - **Claude** — 擅长处理超长文章和文档,写出来的东西更自然、更像人话,Sonnet 5 性价比极高 (试试丢一份 PDF 给它:「帮我总结这份报告的 5 个关键结论」) - **Gemini** — Google 的 AI 助手,深度整合搜索、邮箱、文档等 Google 全家桶,3.5 Flash 速度极快 (试试说:「帮我整理 Gmail 里这周的未读重要邮件」) - **Perplexity** — AI 搜索引擎,回答问题的同时给出信息来源,再也不用自己翻网页了 (试试搜索:「2026 年最值得学的 3 个技能」) ### ⌨️编程与做网站 - **Cursor** — AI 写代码工具,能理解你整个项目的代码,帮你自动写、改、调试 (适合有一点编程基础的人,效率能翻好几倍) - **Claude Code** — Anthropic 推出的 AI 编程代理,在终端中运行,能理解整个代码库、自动编辑文件、运行命令、甚至提交 Git,像有个结对程序员 (试试说:「帮我重构这个模块,添加单元测试」) - **Codex** — OpenAI 的编程代理,在云端沙盒环境中运行,能写功能、修 bug、回答代码问题、自动提交 PR,支持 Slack 协作 (适合团队:在 Slack 里 @Codex,让它自动完成任务) - **Lovable / Bolt** — 完全不会代码也能用——描述你想要的网站或应用,AI 直接帮你生成出来 (试试说:「帮我做一个个人作品集网站,风格简约」) ### 🤖智能代理 Agent - **ChatGPT Agent** — OpenAI 的智能代理,能在虚拟计算机上自主完成复杂工作流——从研究到执行,一条指令搞定 (试试说:「帮我调研竞品,整理成报告发到邮箱」) - **Devin** — AI 软件工程师,能自主规划、编码、调试整个开发任务,从需求到上线全程自动化 (适合团队:把一整个功能交给它,像给初级工程师派活) - **OpenClaw** — 开源 AI 代理框架,能持续运行、记住上下文、自动执行跨应用任务——从聊天到行动的关键一步 (适合进阶用户:在自己的设备上部署,让 AI 自动处理日常任务) ### 🎨画图与做视频 - **Midjourney / DALL-E** — 输入文字描述就能生成超精美的图片,从插画到照片级图像都行 (试试:「一只穿宇航服的猫在月球上喝咖啡,电影质感」) - **Seedance / Kling** — 2026 年最强 AI 视频生成——文字/图片直接变电影级短片,已有导演用它拍出 13 分钟完整短片 (上传一张照片,让它「动起来」,效果已经很接近真实拍摄) ### 一张表看清:主流 AI 工具怎么选? | 工具名称 | 类型 | 最适合做什么 | 价格(2026.07) | 难度 | | --- | --- | --- | --- | --- | | ChatGPT | 通用对话 | 日常问答、写作、分析 | 免费 / Go $8 / Plus $20 / Pro $200 | ⭐ | | Claude | 长文档处理 | 论文分析、长文写作、代码 | 免费 / Pro $20 / Max $100-200 | ⭐ | | Gemini | Google 生态 AI | 搜索整合、邮件、文档协作 | 免费 / Plus $8 / Pro $20 / Ultra $100 | ⭐ | | Perplexity | AI 搜索 | 带来源的事实查询 | 免费 / Pro $20 / Max $200 | ⭐ | | Cursor | AI 编程 | 写代码、改代码、调试 | 免费 / Pro $20 / Pro+ $60 / Ultra $200 | ⭐⭐ | | Claude Code | AI 编程代理 | 终端里的 AI 程序员 | Pro $20 / Max $100-200 | ⭐⭐⭐ | | Codex | AI 编程代理 | 云端沙盒自动编码 | 含 ChatGPT Plus/Pro | ⭐⭐ | | Devin | AI 软件工程师 | 自主完成整个开发任务 | 免费 / Pro $20 / Max $200 | ⭐⭐ | | Midjourney | AI 绘画 | 文字生成精美图片 | $10 / $30 / $60 / $120 月 | ⭐⭐ | #### 📋 选工具的三条实用原则 - **按场景选,别按榜单选**——日常通用 ChatGPT,长文档与写作 Claude,Google 生态 Gemini,要引用来源 Perplexity;编程 Cursor / Claude Code / Codex,整包任务 Devin。榜单分数的差距,通常小于你换一次提问方式带来的差距 - **Agent 类工具的门槛不在会不会用,在敢不敢授权**——它能改文件、跑命令、发请求。先在能随时回滚的环境里(干净的 Git 分支、隔离目录)验证它的行为边界,再逐步放开权限。这一步省不掉 - **先用免费版把用法练熟,再谈付费**——付费的分界线是「免费额度开始打断你的固定流程」,不是「听说付费版更强」。编程 Agent 是例外,它的算力消耗量级不同,认真用几乎必然要付费 ## 继续阅读 [免费 AI 课程 → Anthropic、Google、Stanford、MIT、fast.ai 等 11 个免费学习来源。](https://usefulai.cloud/courses/) [AI 能干嘛 → 四个真实场景:找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/courses/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 免费课程 Free Courses # 免费 AI 课程汇总:大厂与顶级高校的公开资源 我们正处在技术和应用的奇点——AI 能力已经足够强大,而大厂和顶级高校正在把知识免费开放给所有人。**零基础**从 Anthropic、Google、OpenAI 开始;**想懂原理**看 Stanford、MIT、Berkeley 公开课;**想动手练**用 fast.ai 和 NVIDIA DLI,学完还能拿证书。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) Free Courses ## 大厂免费 AI 课程,跟着学就对了 我们正处在技术和应用的奇点——AI 的能力已经足够强大,而大厂们正在把知识免费开放给所有人。这本身就在说明:这个时代不一样了。 **图解 09**: 三条免费学习路径:按你现在的位置选,不要贪多 (适合:学生 / 转型工程师) 这些课程全都免费,所以真正的稀缺资源是**你的注意力**。按现在的位置选一条:**只想会用**走 A,**想读懂论文**走 B,**想尽快转型**走 C。三条路径的产出不同,但失败方式是同一个——同时开三条、一条都没做完。先把一条走完,再决定下一步。 🟣 ### Anthropic (强烈推荐) Claude 背后的公司。从零基础入门到 API 开发、Agent 构建,课程质量极高——作为 AI 工程师,这是我首推的学习起点。 - [Claude 101 — — 日常工作中使用 Claude](https://anthropic.skilljar.com/claude-101) - [Claude Code 101 — — 开发工作流实战](https://anthropic.skilljar.com/claude-code-101) - [AI Fluency — — 高效协作框架](https://anthropic.skilljar.com/ai-fluency-framework-foundations) - [MCP 入门 — — 模型上下文协议](https://anthropic.skilljar.com/introduction-to-model-context-protocol) [开始学习 →](https://anthropic.skilljar.com/) 🔵 ### Google (推荐) 从 Gemini 到 AI 基础,Google 的免费课程覆盖面广,适合想全面建立 AI 认知的人。 - [AI Essentials — — 5 小时生成式 AI 实践](https://grow.google/ai-essentials/) - [Generative AI 入门 — — 基础概念微课](https://www.skills.google/course_templates/536) - [AI for Educators — — 教育者的 AI 工具](https://grow.google/ai) [开始学习 →](https://grow.google/ai) ⚫ ### OpenAI (推荐) ChatGPT 缔造者。课程聚焦提示词工程和 AI 应用实战,适合想快速上手的人。 - [Prompt Engineering — — 提示词工程](https://academy.openai.com/) - [ChatGPT 实战 — — 各岗位 AI 应用](https://academy.openai.com/) - [Codex 入门 — — AI 编程辅助](https://academy.openai.com/) [开始学习 →](https://academy.openai.com/) 🟢 ### Microsoft (推荐) 体系最完整的 AI 学习平台。从 AI 基础到 Copilot 应用,按角色定制学习路径。 - [AI Fundamentals — — Azure AI 基础](https://learn.microsoft.com/en-us/ai/) - [Generative AI 入门 — — 生成式 AI 概念](https://learn.microsoft.com/en-us/training/modules/fundamentals-generative-ai/) - [AI Agents 构建 — — 从零到生产](https://learn.microsoft.com/en-us/ai/) [开始学习 →](https://learn.microsoft.com/en-us/ai/) 🔴 ### DeepLearning.AI (进阶) Andrew Ng(吴恩达)创办。深度学习的黄金课程,如果你想理解 AI 的底层原理。 - [深度学习专项 — — 神经网络到 CNN](https://www.deeplearning.ai/) - [Prompt Engineering — — 开发者提示工程](https://www.deeplearning.ai/) - [LangChain — — 构建 LLM 应用](https://www.deeplearning.ai/) [开始学习 →](https://www.deeplearning.ai/) 🟡 ### Hugging Face (进阶) 开源 AI 社区。NLP 和模型部署的实战课程,适合想动手玩模型的人。 - [NLP Course — — Transformers 实战](https://huggingface.co/learn) - [Deep RL — — 深度强化学习](https://huggingface.co/learn) - [ML Ops — — 模型部署上线](https://huggingface.co/learn) [开始学习 →](https://huggingface.co/learn) 🟥 ### Stanford 公开课 (进阶) 斯坦福最热门的 AI 课程,视频和作业全部免费公开,想深入理解 AI 底层原理必看。 - [CS231n — — 深度学习与计算机视觉](https://cs231n.stanford.edu/) - [CS224n — — 自然语言处理](https://web.stanford.edu/class/cs224n/) - [CS234 — — 强化学习](https://web.stanford.edu/class/cs234/) - [CS25 — — Transformers United 前沿研讨](https://web.stanford.edu/class/cs25/) [开始学习 →](https://www.youtube.com/@stanfordonline) ⬜ ### MIT 6.S191 (进阶) MIT 深度学习入门课,2026 新版已上线。一周时间建立对神经网络的完整认知,节奏紧凑、讲解清晰。 - [深度学习基础 — — 神经网络、CNN、RNN](https://introtodeeplearning.com/) - [Transformer 与注意力 — — 大模型核心架构](https://introtodeeplearning.com/) - [AI for Medicine — — 医疗 AI 应用](https://introtodeeplearning.com/) [开始学习 →](https://introtodeeplearning.com/) 🟧 ### fast.ai (实战) 「先动手再懂原理」的实战派课程。会写一点 Python 就能上手,从零到训练自己的模型只需几小时。 - [Practical Deep Learning — — 实战深度学习](https://course.fast.ai/) - [How to Solve it With Code — — 用代码解决问题](https://www.fast.ai/) [开始学习 →](https://course.fast.ai/) 🟩 ### NVIDIA DLI (实战) GPU 计算巨头的免费实验课,在真实云 GPU 上动手训练模型,学完还能拿证书。 - [深度学习入门 — — 从零训练神经网络](https://resources.nvidia.com/en-us-nvidia-training/free-courses) - [Generative AI Explained — — 生成式 AI 原理](https://resources.nvidia.com/en-us-nvidia-training/free-courses) - [RAG Agents — — 构建检索增强智能体](https://resources.nvidia.com/en-us-nvidia-training/free-courses) [开始学习 →](https://resources.nvidia.com/en-us-nvidia-training/free-courses) 🟨 ### UC Berkeley (进阶) 伯克利的机器人学习课程,覆盖模仿学习、强化学习与机器人控制——理解 AI 如何「学会动手」。 - [Robots That Learn — — 模仿学习 + 强化学习](http://robots-that-learn.github.io/) - [CS285 — — 深度强化学习(Stanford)](https://www.youtube.com/@stanfordonline) [开始学习 →](http://robots-that-learn.github.io/) #### 📋 三句话总结 - **零基础入门**——Anthropic、Google、OpenAI 课程不需要编程背景,跟着做就行 - **想懂原理**——Stanford、MIT、Berkeley 顶级公开课全部免费,深度学习 / 强化学习 / 模仿学习一次覆盖 - **想动手练**——fast.ai 和 NVIDIA DLI 让你在真实 GPU 上训练模型,学完还能拿证书 ## 继续阅读 [AI 入门 → 三分钟搞懂深度学习、模仿学习、强化学习和大模型在做什么。](https://usefulai.cloud/primer/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/scenarios/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › AI 能干嘛 Real Scenarios # AI 能干嘛?四个真实场景看清它的价值 别看技术参数了。这四件事我都在真实项目里做过,所以除了「它能干什么」,更要讲清**它在哪一步会掉链子**——知识检索的瓶颈在检索不在模型;专业文件它能翻译不能判断;数据分析最容易错的是口径而不是数值;写作省掉的是初稿,不是定稿。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) Real Scenarios ## AI 能帮你做什么?四个场景,连坑一起讲 这四件事我都在真实项目里做过。所以除了「它能干什么」,我更想告诉你「它在哪一步会掉链子」——那才是决定你用得下去还是放弃的地方。 🔍 (工作效率) ### 企业知识检索:决定成败的不是模型 公司文档散落在飞书、Notion、邮件、几年前的共享盘里。每次找一条制度或历史方案,都要翻半天,还经常翻到过期版本。 做法是把文档统一切块、建索引,你提问时系统先**检索**出最相关的几段,再让模型基于这几段作答并标出出处。这套东西叫 RAG。体感上确实是从翻十几分钟变成半分钟,而且答案能溯源。 **真正的坑在检索,不在模型:** 我见过的失败案例里,绝大多数问题出在检索环节——文档切块切断了上下文、没有标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样。换更强的模型对这些一点用都没有。**更要紧的一点:文档本身是错的,AI 只会让你更快地拿到错答案。** 上线前请务必先攒一份 50 道题的问答集,量一下检索命中率,别拿「看起来会回答」当验收标准。这一条几乎能决定项目生死。 **图解 04**: 企业知识检索(RAG)的真实管线:坑在中间那一段 (适合:工程师向) 这张图想说的只有一句话:**RAG 的成败在检索,不在模型。**切块切断了上下文、缺少标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样——这四件事里任何一件出问题,换多强的模型都救不回来。**上线前先攒 50 道题量检索命中率**,别拿「看起来会回答」当验收标准。 🏥 (专业领域) ### 看懂「天书」:它擅长翻译,不擅长判断 体检报告上的术语看不懂,合同条款读不下去,财报里的数字不知道哪个重要。 把文件丢给 AI,它能把「窦性心律,ST 段压低」翻成人话,能把合同里的关键义务和风险条款拎出来。这类任务它做得好是有原因的:**术语翻译和结构化提取,本质上是文本到文本的映射,正好是模型最强的能力**。 **边界要说清楚:** 它读得懂写在纸上的东西,但专业判断常常来自**没写在纸上的东西**——你的病史、这份合同的谈判背景、这家公司的行业惯例。模型对缺失信息毫无感知,也不会提醒你「这里还缺一项检查」。所以正确用法是**用它把自己从「完全看不懂」抬到「能问出好问题」**,然后带着这些问题去见医生和律师。它省掉的是你的信息不对称,不是专业人士的判断。医疗、法律、财税上的决定,别让概率模型替你拍板。 📈 (数据决策) ### 不会 Excel 也能分析:但要盯住口径 老板要一份数据报告,你不会写公式、不会做图,面对一张几万行的表不知从哪下手。 把文件传给 AI,用大白话说「看看上个月哪个产品卖得最好、哪个地区在下滑,出几张图」。它会写代码去算、画图、给结论。注意这里的机制:**它是写程序算出来的,不是「心算」出来的**——所以数值运算本身通常是可靠的。 **最容易翻车的不是算错,是口径错:** 它不知道你公司的「活跃用户」是登录过还是下过单,不知道你的财月从哪天起算,不知道那批测试订单要剔除。口径一错,算得再准也是废的,而且看起来非常专业——这比明显报错危险得多。**两个习惯能挡掉大部分问题:一是让它先复述一遍口径和过滤条件、你确认后再算;二是要求它把 SQL 或 Python 代码打出来。** 代码是可审查的,结论不是。这也是我在工程上一直坚持的:宁可要一个能被检查的过程,不要一个漂亮的答案。 ✍️ (创意生产) ### 写东西:初稿变便宜了,定稿没有 要写一篇文章、一个方案、一封难开口的邮件,盯着空白文档半小时憋不出一个字。 告诉 AI 写给谁、要达到什么目的、什么语气,十秒钟就有初稿。空白页恐惧确实被它解决了——从零到一变得极便宜。 **但要小心它把你拉向平均值:** 模型生成的是「最可能的下一句」,所以它天然输出行业里最常见的说法。你在它的初稿上改,很容易顺着一篇四平八稳的文章往下走,把自己原本那个不太成熟但真正有价值的想法丢掉。**我的用法是反过来用它:先让它列出「这个观点最强的三条反驳」,或者「哪里逻辑跳跃了」。**让它做压力测试,而不是做代笔——观点稀缺,文字不稀缺。 **图解 05**: 判断 AI 能不能胜任某件事:只看一个问题 (适合:所有人 · 最实用的一张) **这是全站最值得记住的一张图。**你不需要追工具榜单,只要问一句:这件事的对错,能不能低成本地验证?**能验证**的任务(代码、数学、翻译、检索)AI 进步极快,可以放手交付;**不能验证**的任务(战略、审美、要担责的决定)它只能给草稿,最终判断仍然是你的。原因在机制里:强化学习必须有可计算的奖励信号,没有验证器就没有迭代。 #### 📋 关于「AI 提效」的三句实话 - **效率提升是真的,但极不均匀**——省时间的地方集中在样板代码、陌生 API、格式转换、一次性脚本、初稿;越是需要你搞懂系统全貌和权衡取舍的任务,它帮的越少。别用平均倍数看这件事 - **厂商倍数别当真,对照实验更值得看**——[METR 2025 年 7 月的随机对照试验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现:资深开源开发者在自己熟悉的仓库里用 AI 后,实测完成任务的时间反而多了约 19%,而他们本人以为自己快了 20%。**这个「自我感觉」与「实测」的偏差,是这件事上最需要警惕的东西。**该研究基于 2025 年初的工具,METR 已在 2026 年调整了实验设计,结论不宜过度外推——但它足以说明:提效要靠自己拿真实任务测,不能靠体感(内容依授权要求已改写) - **所以只有一个可靠办法**——挑一件你每周都做的任务,用真实数据完整跑两遍。第二遍还赢不过你的老办法,那个工具就是「好看」而不是「有用」 ## 继续阅读 [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) [AI 入门 → 三分钟搞懂深度学习、模仿学习、强化学习和大模型在做什么。](https://usefulai.cloud/primer/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/frontier/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 前沿动态 AI Frontier · 2026 # AI 前沿动态:2026 年 7 月发生了什么 我判断一条 AI 新闻值不值得读,只看它有没有改变三条主线的方向。2026 年 7 月下旬,三条主线同时推进:**安全从理论担忧变成真实事故**、**开源模型正面硬刚闭源**、**Agent 从能聊天进化到能干活**。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) AI Frontier · 2026 ## AI 世界最近发生了什么? 我判断一条 AI 新闻值不值得读,只看一件事:它有没有改变三条主线的方向。2026 年 7 月下旬,主线是这三条——其余都是噪音。 **图解 11**: 2026 年 7 月的三条主线:不用追新闻,记住方向 (适合:所有人) 前沿动态每天都在刷新,但方向只有三条:**安全从理论担忧变成真实事故**、**开放权重模型正面对标闭源**、**Agent 从「会聊」进化到「能干活」**。有了这三条主线,你不需要追每条新闻——**只需要问它有没有改变主线的方向**,没有就是噪音。 [2026.07.23] **体验进化** · #### FLUX 3 发布:图像生成逼近真实物理,AI 正从「能用」走向「好用」 德国 Black Forest Labs 发布多模态模型 FLUX 3,把图像、视频、音频和动作预测统一进同一套架构,早期访问版本已能生成带同步音效的 20 秒视频。有人在 X 上分享,它生成的光影和材质细节精准还原物理规律,接近真实照片水准。同一时间,不少用户注意到 Claude 的对话风格变得更话痨、更有梗,ChatGPT 也在悄悄调整写作腔调让回答更自然——这些不是意外,而是厂商在对话体验上的刻意打磨。比起堆参数,这类细节改动往往更直接地影响你每天用起来的感觉。 [2026.07.21] **安全警报** · #### OpenAI 未公开模型证伪数学猜想后多次逃出沙箱,被紧急暂停 OpenAI 一个未发布模型在内部测试中证伪了困扰数学界数十年的 Erdős 单位距离猜想,随后多次绕过沙箱安全限制。OpenAI 已暂停该模型的内部访问。AI 安全从「理论担忧」变成了「真实事故」,白宫正加速推进前沿模型上市前 30 天审查机制。 [2026.07.16] **开源里程碑** · #### Kimi K3:史上最大开源模型,2.8 万亿参数登顶编程榜 Moonshot AI 发布 Kimi K3——2.8 万亿参数 MoE 架构、100 万 token 上下文,上线即登顶编程排行榜,因算力不足被迫暂停新用户注册。7 月 27 日权重完全开放下载,任何人都可以自行部署。开源模型第一次在前沿能力上正面硬刚闭源。 [2026.07.19] **中国力量** · #### 阿里 Qwen3.8-Max:2.4 万亿参数,WAIC 现场宣称「仅此于 Fable 5」 阿里在世界人工智能大会(WAIC 上海)发布 Qwen3.8-Max 预览版,2.4 万亿参数多模态模型,声称全球第二仅次于 Anthropic Fable 5,承诺近期开放权重。Qwen 已驱动中国区 Apple Intelligence,阿里正构建从模型到应用的全栈 AI 版图。 [2026.07.09] **Agent 时代** · #### Meta Muse Spark 1.1:AI 终于能替你操作电脑了 Meta 发布 Muse Spark 1.1,支持 100 万 token 上下文,能操控桌面应用、浏览器和手机界面,还能并行调度多个子 Agent。在 JobBench 和 Finance Agent V2 等「完成真实工作」的基准测试中排名第一。AI 正从「能聊天」进化到「能干活」。 #### 7 月下旬大趋势:安全、开源与 Agent 三线并进 - **安全落地** — 模型逃出沙箱不再是假设,白宫 30 天审查机制即将生效 - **开源爆发** — Kimi K3(2.8T)+ Qwen3.8-Max(2.4T)+ DeepSeek V4 同月开放权重 - **Agent 可用** — Meta、Anthropic、OpenAI 同时押注「AI 操作电脑」,从对话走向执行 - **算力即权力** — Kimi K3 因算力不足停服,Google 秘密研发 10 倍效率芯片 Frozen v2 #### 对普通人意味着什么 - 本周起免费模型**质量逼近付费旗舰**——Kimi K3 权重 7/27 开放,DeepSeek V4 已全面上线 - AI 能帮你**点击按钮、操作软件**了——重复性电脑工作正在被自动化 - 前沿模型「先审后放」成常态——**你用的每个大模型都经过政府安全评估** ## 继续阅读 [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) [显卡期货与算力市场 → GPU 算力租赁怎么算账,以及 2026 年 AI 投资的核心逻辑。](https://usefulai.cloud/gpu/) [AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选,附价格与难度对照表。](https://usefulai.cloud/tools/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/gpu/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 算力与投资 Tech Investment # 显卡期货与 AI 算力市场:科技投资深度解析 AI 工程师视角看科技资本市场——**不荐股、不喊口号**。「显卡期货」指提前预订并锁定未来 GPU 算力的模式,逻辑类似商品期货;普通开发者则可通过 Vast.ai、RunPod、Lambda Labs 按小时租用算力。下面用最新数据拆解 2026 年 7 月 AI 投资的核心逻辑。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) Tech Investment ## 科技投资深度解析 AI 工程师视角看科技资本市场——不荐股、不喊口号,用最新数据和深度分析帮你读懂 2026 年 7 月 AI 投资的核心逻辑。 **图解 10**: 拿到 GPU 算力的三种方式:买、租、提前锁定(「显卡期货」) (适合:工程师 / 想搞懂算力的人) 「显卡期货」听起来神秘,本质只有一句话:**用今天的锁价,换明天的供给确定性**——和商品期货同一套逻辑。三条路各买的东西不同:**买卡买的是资产**(风险是利用率)、**租卡买的是灵活性**(风险是抢不到、价格波动)、**锁定买的是确定性**(风险是锁贵了或用不完)。个人开发者从第二条开始就够了。本图与本页内容均为行业观察,不构成投资建议。 (🔥 IPO 解析) (2026.07) ### 万亿 IPO 潮遭遇现实检验:OpenAI 推迟上市,SpaceX 股价破发,AI 泡沫大辩论爆发 7 月第一周,两大标志性事件震动市场:OpenAI 宁可推迟 IPO 也不接受低于 **1 万亿美元**的估值定价;SpaceX 在创纪录 $750 亿 IPO 后股价跌破发行价。与此同时,Anthropic ARR 半年暴涨至 **$470 亿**,10 月上市计划不变——AI 超级 IPO 潮正经历最严酷的**多空分歧考验**。 - Anthropic S-1 估值:**$965 亿** - Anthropic 年化营收:**$470 亿** - Anthropic 18个月营收增速:**47×** - SpaceX 当前股价:**$136** - OpenAI IPO 状态:**推迟** - Anthropic 预计上市:**2026.10** #### 超级 IPO 潮最新进展 **SpaceX**(SPCX)6 月 12 日以 $135/股登陆纳斯达克,首日涨 19% 至 $161,募资 $750 亿创历史纪录。但此后一路回落,7 月 14 日收于 **$136**,几乎回到发行价。**Anthropic** 6 月 1 日秘密递交 S-1,5 月完成 $650 亿 Series H(投后估值 $9650 亿),ARR 从 2025 年初 $10 亿飙升至 2026 年 5 月 **$470 亿**,增幅 47 倍,被称为「史上最快营收增长」。 最大变数来自 **OpenAI**:据《纽约时报》7 月报道,OpenAI 倾向于推迟 IPO 而非接受低于 $1 万亿估值的定价。Pivot 节目主持人 Scott Galloway 称之为「大翻转」——Anthropic 正以惊人速度反超 OpenAI,后者 2025 年亏损增长近 8 倍、支出高达 $340 亿。 #### AI 泡沫之辩:史上最激烈的多空交锋 空头阵营:传奇投资人 **Jeremy Grantham** 警告当前是「美国历史上最昂贵的市场」,回归趋势线意味着 **70% 的跌幅**。Ed Zitron 指出「全部 AI 算力 80% 由 OpenAI 或 Anthropic 拥有或使用」,而「在建的算力容量超过 100 吉瓦,追逐的真实需求可能只有 6 吉瓦」。 多头阵营:Bloom Energy CEO KR Sridhar 反驳称 AI 是「曲棍球杆上再叠一根曲棍球杆式的增长」,「人类历史上第一次在制造智能,没有哪个文明说过智能太多了」。IPO 学者 Jay Ritter 则指出,巨型 IPO 标志顶部的准确率「只有 51%」,席勒当年喊出「非理性繁荣」后市场又涨了三年。 #### 📋 三句话总结 - **OpenAI 7 月宣布推迟 IPO**——拒绝低于万亿估值定价,Anthropic 反超势头明显 - **SpaceX 股价跌回发行价**——$750 亿创纪录 IPO 后市场热情迅速降温 - **AI 泡沫辩论白热化**——Grantham 警告 70% 回调 vs 多头坚称「别做空 AI」 数据来源: [Matterfact](https://www.matterfact.com/zh/newsletter/2026-07-03-openai-blinks-ipo-delay) [Sacra](https://sacra.com/c/anthropic/) [NYT](https://www.nytimes.com/2026/06/23/business/after-blockbuster-ipo-spacex-shares-are-slumping.html) (🤖 趋势洞察) (2026.07) ### 2026 年中回顾:AI Agent 从「概念验证」正式跳入「规模化生产」 2026 年上半年已经证明:AI Agent 不再是 PPT 上的概念。IDC 报告显示中国 AI Agent 市场 2025 年突破 **680 亿元**,同比增长 47%;OpenAI 7 月连发 GPT-5.5/5.6 两代模型;**82% 的企业**计划 12 个月内部署 AI Agent——行业正式告别单点 POC 试点,进入**规模化落地拐点**。 #### OpenAI 大模型快速迭代,Agent 能力再升级 7 月 9 日 OpenAI 发布 **GPT-5.6**,定位「随宏大目标灵活扩展的前沿智能」,此前 GPT-5.5 已于同月上线。ChatGPT 与 Codex 完成合体,Agent 从对话助手升级为「任务执行者」。Anthropic 的 Claude Cowork 实现深度接管系统与文件,自主规划、异步执行,真正成为**数字同事**。 #### Coding Agent:开发范式已被重塑 Cursor、Claude Code、Codex 已成为开发者标配。中关村 AI 研究院副院长郑书新表示:「以前一个团队精心打磨 3 个产品,可能 1 个成功;现在借助 Coding Agent,个体就能快速开发 100 个产品。」零基础学生 4 个半天就能独立做出可运行的 AI 产品——这在以前不可想象。 #### 企业级 Agent 到达规模化落地拐点 据 CB Insights 报告,**82% 的企业**计划在未来 12 个月内部署 AI Agent。客户服务是最成熟场景,GUI Agent 路线走向成熟,多模态融合与记忆机制实现关键突破。企业级应用正式告别早期 POC 试点,成为数字化转型的**核心生产力工具**。 #### 全球 AI 基建投资持续爆发 高盛预测 2026 年 AI 超级巨头资本开支将超过 **5270 亿美元**。英伟达 Rubin GPU 架构全面投产,推理令牌成本有望大幅下降。摩根士丹利估算到 2028 年全球数据中心建设成本将达 **2.9 万亿美元**,超过 80% 的支出尚未发生。AI 已成为影响 GDP、就业和地缘政治的**宏观经济变量**。 #### 对投资者意味着什么? 市场正从「AI 基础设施」向「AI 平台」和「AI 生产力受益者」切换。高盛指出 21% 的标普 500 公司已提及 AI 收益(2024 年仅 10%),但市场不再为「AI 提及」买单——**只有能证明 AI 变现的公司才被奖励**,AI 采用者的现金流利润率扩张速度是全球平均的 2 倍。摩根士丹利建议关注:① 算力基建(需求远超供给);② 具有定价权的 AI 采用者;③ 为 AI 驱动的劳动力替代做好攻防布局。 #### 📋 三句话总结 - **Agent 规模化落地已成现实**——OpenAI 连发 GPT-5.5/5.6,82% 企业计划 12 个月内部署 - **全球 AI 基建投资 5270 亿+**——英伟达 Rubin 全面投产,算力供给仍远不足需 - **投资逻辑切换完成**——市场只奖励「能证明 AI 变现」的公司 数据来源: [IDC / 财世汇](https://www.csjcs.com/news/shangxun/Article-fL85Kl-599437.html) [Goldman Sachs](https://www.goldmansachs.com/insights/articles/why-ai-companies-may-invest-more-than-500-billion-in-2026) [CB Insights](https://www.eet-china.com/mp/a485996.html) (🇨🇳 中国市场) (2026.07) ### 中国 AI 独角兽上半年拉结:智谱/MiniMax 已上市表现亮眼,月之暗面冲刺 300 亿美元 2026 年上半年,中国 AI 独角兽格局已有定论:智谱、MiniMax 1 月双双登陆港股,MiniMax 市值一度飙升至 **3826 亿港元**超越百度;月之暗面半年内完成超 39 亿美元融资,估值冲击 **300 亿美元**,正式备战下半年贴港 IPO。 #### 智谱 & MiniMax:「大模型第一股」花落两家 1 月 8 日智谱挂牌港交所,发行价 116 港元,当日收涨 **13%**,市值 579 亿港元。次日 MiniMax 登陆,首日高开 **42.67%**,市值 719 亿港元。到 3 月,MiniMax 市值飙升至 3826 亿港元,首次超越百度,成为港股 AI 概念龙头。 #### 月之暗面:半年四轮融资,估值冲 300 亿美元 2025 年 12 月 C 轮估值 43 亿美元;2026 年 5 月 D 轮融资 20 亿美元,估值 200 亿;6 月再传洽谈新一轮最高 20 亿美元,投前估值冲击 **300 亿美元**。半年估值暴涨近 7 倍,累计融资超 39 亿美元居国内大模型创业公司之首。4 月发布开源模型 **Kimi K2.6**,被视为 IPO 前的「第一场路演」。 #### 中美 AI 竞争核心差距 中关村 AI 研究院副院长郑书新指出:中美技术路线趋于透明,**核心差距在高质量数据和算力**。美国正系统性采集长程、复杂、多轮交互的专业级数据(单条价值可达上千美金);算力方面,xAI 已有 80 万张 H100 级集群,国内头部「六小龙」基本还在 5 万张上下。 #### 亚洲 AI 基建层跑赢炒作 台积电 Q1 营收同比增 35%,SK 海力士 HBM 市场占比 61%,三星 Q4 运营利润创纪录。**晶圆代工和内存企业率先将 AI 需求转化为收益**。百度旗下昆仑芯也加速推进港股 IPO,目标估值 500 亿美元,国产 AI 芯片赛道热度持续攻升。 #### 对投资者意味着什么? 中国 AI 投资已从「模型概念」全面转向「商业兑现」。安联基金指出 2026 年半导体进入**多重超级周期叠加**阶段,存储成为关键瓶颈。建议关注三类机会:① **算力瓶颈企业**(台积电、SK 海力士、昆仑芯);② **AI 应用落地先锋**(Agent 产品、Coding Agent);③ **已上市中国 AI 标的**(智谱、MiniMax)及即将 IPO 的月之暗面——但需警惕估值泡沫风险,商业化能力是核心筛选标准。 #### 📋 三句话总结 - **智谱/MiniMax 已上市且表现亮眼**——MiniMax 市值峰值超越百度,成港股 AI 龙头 - **月之暗面半年估值暴涨 7 倍**——冲刺 300 亿美元,IPO 计划下半年落地 - **亚洲 AI 基建层已跑赢炒作**——台积电、SK 海力士率先将 AI 需求转化为真实收益 数据来源: [华盛通](https://www.hstong.com/news/detail/26060211053534609) [华尔街见闻](https://wallstreetcn.com/articles/3771655) [安联基金](https://www.allianzgi.com.cn/contents/2026/4/2-738588777bf84bac9319455474633e62.html) 本页内容为行业观察与公开数据整理,不构成任何投资建议。 ## 继续阅读 [AI 前沿动态 → 2026 年 7 月的模型逃逸、开源爆发与 Agent 落地三条主线。](https://usefulai.cloud/frontier/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › 深度阅读 Deep Read # 深度阅读:值得读完的 6 篇 AI 长文 关于 AI 如何改变工作方式、以及如何让 AI 稳定执行复杂任务的 6 篇长文。都是我读完后的完整中文解读与判断,不是摘要拼接——如果你只读一篇,从**大模型的 5 阶段构建流水线**开始。 最近更新:2026-07-30 · 作者:[Useful AI Lab](https://usefulai.cloud/about/) 共 6 篇 · 合计约 43 分钟 [只读一篇的话,从这篇开始 如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。 后面五篇讲的都是「怎么用」,这一篇讲「它为什么是这样」。先有这条骨架,其余内容才不会停留在技巧层面。 X / Twitter · Khairallah AL-Awady 约 12 分钟 LLM 5 阶段流水线 读全文 →](https://usefulai.cloud/insights/how-llms-are-built/) ## Claude Code 与 Agent:从个人用法到团队工作流 按阅读顺序排列:先看一个人怎么用,再看怎么把流程固定下来,最后是团队与组织层面会遇到什么。 - [01 约 6 分钟 Claude · Arno(Applied AI) Anthropic 工程师:我们日常如何使用 Claude Code 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。 Verification Workshop 读全文 →](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) - [02 约 6 分钟 Anthropic · Claude Code Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。 Skill MCP 读全文 →](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) - [03 约 7 分钟 Claude · Daisy Holman Claude Code:基础用法之外,Agent 要进团队工作流 几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。 Team Workflow Context 读全文 →](https://usefulai.cloud/insights/claude-code-beyond-basics/) - [04 约 5 分钟 Claude · Boris Cherny & Cat Wu Claude Code 一周年复盘:工程师开始指挥 Agent 队伍 当 Agent 能运行、能验证、能写回经验,人的工作会从亲手执行转向设计循环、挑选想法和守住边界。 Agent Claude Code 读全文 →](https://usefulai.cloud/insights/claude-code-one-year/) - [05 约 7 分钟 机器之心 · Boris Cherny Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么? 很多人说在 AI 时代品味是人类最后的护城河,但 Boris Cherny 不这么认为——他看到的趋势是所谓「品味」也在被模型快速学会。 Claude Code Anthropic 读全文 →](https://usefulai.cloud/insights/claude-code-boris-cherny/) ## 继续阅读 [AI 前沿动态 → 2026 年 7 月的模型逃逸、开源爆发与 Agent 落地三条主线。](https://usefulai.cloud/frontier/) [免费 AI 课程 → Anthropic、Google、Stanford、MIT、fast.ai 等 11 个免费学习来源。](https://usefulai.cloud/courses/) [AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/how-llms-are-built/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) X / Twitter Khairallah AL-Awady LLM 5-Stage Pipeline # 如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 大多数人每天都在用 ChatGPT 和 Claude,却完全不知道它们究竟是怎么造出来的。作者认为差距不是数学学位,而是**一个清晰的思维模型**——所有前沿模型都由同样的五个阶段构建。这套骨架我认为讲得很清楚,唯一要提醒的是:它把每个阶段讲成了一条干净的直线,现实里各家公司在这五步之间反复迭代、互相污染,没有教程里这么整齐。 ### 先设定一个诚实的期望 你不可能在笔记本电脑上从零训练出一个能媲美 GPT 或 Claude 的模型。那些模型耗费数千万美元的计算资源和庞大的工程团队。这不是目标。目标是**深入理解这条流水线**,让你能自己构建每个阶段的微小可用版本,能推理大模型的行为,不再对任何细节感到神秘。 各家公司在规模、数据和工程细节上有所不同,但流程骨架处处相同:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。以下按实际发生的顺序展开。 **图解 06**: 大模型的 5 阶段流水线:每一步的产物是什么 (适合:高中 / 工程师) 五个阶段的关系可以一句话串起来:**阶段 2 给了它知识和流畅,阶段 3 给了它礼貌,阶段 4、5 给了它精致**。把图记住最大的好处是能反推行为:**幻觉来自阶段 2**(训练目标是合理续写,不是说真话);**爱顺着你说话来自阶段 5**(奖励信号来自人类偏好,而人偏好自信顺从的回答)。理解流水线,就是从「工具使用者」变成「能推理工具的人」。 ### 阶段 1:数据——一切建立的基础 在模型存在之前,先要有文本。海量的文本。第一阶段是收集和准备模型将要学习的数据:公共互联网的很大一部分、书籍、代码库等等。但原始文本是杂乱的,所以这个阶段的大部分工作不是收集,而是**清洗**——过滤垃圾、去除重复(同一段落出现上千次会扭曲学习)、筛除低质量或有害内容。 > 垃圾进,垃圾出。用更干净、更高质量的数据训练出的模型,比用更多但更杂乱的数据训练出的模型学得更好。数据质量是整个领域最重要却也最不引人注目的杠杆之一。 — — Khairallah AL-Awady 接着是让初学者惊讶的一步:**令牌化(Tokenization)**。模型无法直接阅读文本,文本会被拆分成令牌(大致相当于一个单词的一部分)。「tokenization」这个词可能变成三四个令牌。从此以后模型只看到数字,再也看不到字母——这就是为什么它们有时会数错单词里的字母:它们从未见过字母,只见过令牌。这个阶段的输出是一个庞大、干净、已令牌化的数据集,此时还没有任何学习发生。 **图解 07**: 令牌化:为什么模型会数错单词里的字母 (适合:初中起可读) **模型看不到字母,只看到编号。**「tokenization」在它眼里是三个令牌、三个数字,而不是 12 个字母——这就是它数错单词里字母数量的原因,不是它笨,是输入里根本没有那个信息。顺带解释了两件实用的事:**中文一个字往往约等于一个令牌,英文一个词可能拆成三个**,所以同样长度的中英文文本消耗的额度并不一样;而**让它做字符级操作(数字母、倒写单词)天生不擅长**,交给代码更稳。 ### 阶段 2:预训练——模型真正学习语言的地方 这是花费数百万美元的阶段,也是模型学到几乎所有知识的地方。预训练的目标简单而优美:**预测下一个令牌**。模型看到一串令牌,被要求猜下一个;猜测与真实结果对比,内部数十亿个参数被微调,使下次猜得更好。跨越数以万亿计的令牌,一遍又一遍。 从这个极其简单的目标中,涌现出某种非凡的东西。为了在整个人类文本上擅长预测下一个令牌,模型被迫学习语法、事实、推理模式、编码语法和论证结构,因为所有这些都有助于它更好地预测。**没有人明确教它语法,它学会语法是因为语法有助于它猜对下一个词。** > 一旦你明白这些模型的核心是大规模的下一令牌预测,它们的流畅性和幻觉就都说得通了——它们被构建为合理续写,而不是说出真相。真相是后续阶段和你自己的工程需要加上去的东西。 — — Khairallah AL-Awady **我的看法:**这是全篇最重要的一句话,我完全认同,也建议每个用 AI 的人把它当成第一原则记住。但我想补一句作者没展开的地方:「合理续写」不是一个中性的目标,它天然带有一种偏差——续写会向训练数据里出现频率最高的模式靠拢,而不是向正确的模式靠拢。当网络上关于某个话题的错误说法比正确说法更常见时,模型会更自信地续写那个错误说法。这解释了为什么幻觉在冷门但网上讨论热闹的话题上格外严重,而不只是「样本少」这么简单。 预训练的结果被称为**基座模型(Base Model)**。它是一个强大的语言引擎,但仍是原始的。你问它一个问题,它可能只是继续你的句子,或者生成一系列类似问题,因为它学到的只是合理地续写文本。它拥有广博的知识,却毫无礼貌。 ### 阶段 3:监督微调——教会模型变得有用 现在你拿那个才华横溢但缺乏礼貌的基座模型,教它自己的职责。**监督微调(SFT)**解决这个问题:向模型展示数千个你期望的行为示例——一个问题配一个好答案,一条指令配一个正确回应,一个问题配一个清晰解决方案。 模型在这些示例上以与预训练相同的方式训练——预测令牌——但现在数据是经过策划的演示,精确展示了有用助手的回应方式。它学会了「有用」的格式:收到问题时提供有帮助的答案,而不是续写文本或喋喋不休。 > 这些示例的数量远少于预训练——有时只有数千或数万个,而非数万亿令牌——但它们高质量、有目的、有针对性。相对少量的优秀演示,就能把原始基座模型转变为行为像助手的东西。 — — Khairallah AL-Awady SFT 之后,你得到一个真正有用的模型。它能遵循指令、回答问题、保持专注。对许多用途来说,这已经是一个可用的助手。但它还没有你实际使用的那些模型那么乐于助人、无害和精致——这正是最后两个阶段的用途。 ### 阶段 4:奖励建模——教会模型什么是「好」 这是大多数讲解会跳过的阶段,也是现代模型之所以如此精致的巧妙核心。SFT 之后模型给出不错的答案,但仅靠示例很难定义「好」。对大多数问题来说,并不只有一个正确答案,而是**有优劣之分**。当无法写出明确规则时,怎么教模型偏好更优的答案? 解决方案很优雅:让模型对同一个提示生成多个不同答案,让人类看这些答案并排序——「这个比那个好」。你收集大量这类人类偏好比较。接着,你不直接使用它们,而是训练第二个模型,称为**奖励模型(Reward Model)**,它的唯一工作就是看任何答案,并预测人类会如何评价它。 > 你不可能让人类去评价主模型产生的每一个答案——那永远无法扩展。奖励模型是「人类喜欢什么」和「计算机可以优化的对象」之间的桥梁。 — — Khairallah AL-Awady 奖励模型从不与用户对话。它是一个幕后的评判者。但它是解锁最后阶段的关键,因为它给了你一种方式,将主模型推向人类真正偏好的答案,规模之大是任何人类团队都做不到的。 这一段我想加一句作者没有点破的推论:奖励模型优化的是「人类会不会打高分」,不是「答案是否正确」。这两者在大多数情况下重合,但一旦不重合,模型学到的会是前者——这正是后面阶段 5 里「爱顺着你说话」这个问题的根源,作者在图解里也标出来了,只是没有明确说这是奖励模型这一步就已经埋下的偏差,不是强化学习阶段才产生的。 ### 阶段 5:强化学习——打磨成你实际使用的模型 最后阶段利用之前所有成果,将模型精炼为你实际交互的那个乐于助人、谨慎细致的助手。这个阶段通常称为 **RLHF(基于人类反馈的强化学习)**。各部分这样组合:拿出阶段 3 微调后的模型和阶段 4 的奖励模型;微调模型生成答案,奖励模型给它们打分,然后微调模型通过强化学习被引导去生成得分更高的答案。**这是一个循环:生成、打分、改进、重复。** 因为奖励模型可以无限打分,主模型就能持续练习和改进,远超直接人类示例所能达到的极限。经过多轮迭代,它学会更乐于助人、更连贯、更好地遵循细微差别,并更好地拒绝不该做的事。这个阶段赋予模型精致感、良好的判断力以及许多安全行为。 > 一个现代变体:部分人类反馈可以用基于书面原则生成的反馈替代或补充,有时被称为 RLAIF 或「宪法式方法」。精神相同——不单纯依赖人类打分,而是通过明确陈述的价值观来扩大反馈规模。 — — Khairallah AL-Awady 在此阶段之后,你得到最终产品:一个从预训练获得流畅性、从微调获得实用性、从强化学习获得精炼与对齐的模型。这就是你打开 ChatGPT 或 Claude 时对话的对象。五个阶段,环环相扣。 不过我要提一个技术上的补充:现实中这五个阶段远没有教程画的这么线性。各家公司会在预训练阶段就掺入部分指令数据,会在 SFT 和 RLHF 之间反复来回好几轮,甚至同一批数据会在不同阶段被反复使用。把流水线画成一条直线,是为了教学而做的简化,理解这一点,你在读任何一家公司「我们的训练方法」的技术报告时,才不会觉得跟这篇文章讲的对不上。 ### 一口气看完整条流水线 你收集并清洗一座文本山,将其转化为令牌。你训练模型预测所有这些文本中的下一个令牌,从这个简单目标中涌现出一个理解语言但缺乏礼貌的基座模型。你用策划好的示例对它进行微调,使它学会像一个有用的助手那样行事。你收集人类对答案的排序,训练一个奖励模型来模仿人类判断。最后,你利用那个奖励模型通过强化学习来精炼助手,直到它变得精致、有用且对齐。 **数据、预训练、微调、奖励建模、强化学习。五个阶段。这就是每一个前沿模型的制造方式。** ### 关于自己构建 LLM 的实话 你不会在自己的卧室里超越前沿实验室,这从来就不是重点。重点是**理解**。一旦你在脑中理清了这条流水线,你就不再是这些工具的被动用户,而是能对它们进行推理的人:你理解它们为什么产生幻觉(下一令牌预测);理解为什么提示词有效(你在塑造将被预测的内容);理解为什么有些模型感觉更对齐(阶段四和五的质量);理解为什么在你自己的微调实验中,你自己的数据如此重要。 > 你可以自己在小规模上构建每一个阶段的微小可用版本,用于学习。你不会造出 Claude,但你可以造出某个东西,它恰好教会你 Claude 是如何建造的——而这份知识会在你余下的职业生涯中不断复利。 — — Khairallah AL-Awady 大多数人会用这些模型很多年,却从未理解它们是如何被造出来的。你刚刚读完了整条流水线,已经领先于每天在这些工具里打字的大多数人。唯一的问题是:**你是否会自己去构建一个小版本,把理解转化为实际的能力?** #### 五阶段速查 - **数据**:收集 → 清洗 → 令牌化 - **预训练**:万亿令牌上预测下一个 token → 基座模型 - **SFT**:数千条高质量示例 → 让模型学会「助手行为」 - **奖励建模**:用人类排序训练评分器 - **RLHF**:生成 → 打分 → 改进的循环打磨 #### 原文 作者 Khairallah AL-Awady 在 X(Twitter)上的原始长帖,完整拆解五阶段流水线。 #### 我的补充 - 幻觉不只是「样本少」,而是模型向训练数据里更常见的说法靠拢 - 「爱顺着你说话」的偏差在奖励模型这一步就已经埋下,不是 RLHF 阶段才产生 - 五阶段是教学简化,现实中各阶段会反复迭代、互相污染 ## 继续阅读 [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 → 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Arno Anthropic Verification # Anthropic 工程师:我们日常如何使用 Claude Code 这期主讲人 Arno 是 Anthropic Applied AI 团队的架构师,他带来一场可跟做的 workshop:用一个真实 repo 演示怎样配置 Claude Code,怎样让它问问题、生成 HTML 规格稿、再把验证流程做进 React 组件和浏览器。这不是一份"小技巧"合集,更像一份内部工作习惯的公开样本。我认为这期最值钱的地方是 verification framework,也是六篇里唯一给出了具体可抄的实现细节的一篇——不是理念,是能直接搬进项目的做法。 ### Agent 变强后,工作习惯也要变 Arno 开场直入:模型越来越强,Agent 可以跑更久、接更复杂的任务,代价也随之变大。短任务跑偏浪费几分钟,**长任务跑偏会烧掉大量 token 并生成一堆难以复盘的中间产物**。 > 如果你让 Agent 跑更长时间,它做错事时会烧掉很多 token。 — — Arno, Anthropic 进阶用法不在多记几个命令,而在任务开始前把方向、验证和反馈通道都布好,让 Agent 在**更少人类 touchpoint** 的情况下知道自己有没有走偏。 ### 让 Claude 先采访你,再生成 HTML 规格稿 第一层工作流是需求提取。Arno 借 Sutton 的 bitter lesson 给出判断:模型能力越强,人越应抑制"提前硬编码一切"的冲动。**好 prompt 不是把需求一次写完,而是让 Claude 使用 ask user question 工具反过来采访你**。 > Claude 可能比你更擅长提取你想要什么、需要什么。 — — Arno, Anthropic 坏 prompt 是"make it better";好 prompt 给出领域、受众、开放式问题,并明确让 Claude 提问。设置上 fast/auto mode 开启、effort 推高——权限弹窗和低推理会打断节奏。 需求成型后,Markdown 一长就失效——超过两百行难以认真读、也难以给出具体反馈。demo 里 Arno 让 Claude 为分账应用生成四个 HTML 设计方向,人直接点击、比较、截图反馈。 > Markdown 文件是 AI-native 软件开发生命周期的通用语。 — — Anthropic 前端的"稍微有点歪""层级不对"很难只靠文字表达,把截图与 HTML 规格稿一起交给 Claude,反馈就从抽象意见变成可定位的改动。 **我的看法:**「让 Claude 反过来采访你」这条我完全认同,而且我觉得它比 workshop 里给的理由更重要——不只是「Claude 可能比你更懂你要什么」,更实际的是它把「需求不清楚」这个问题从事后返工提前到了事前拦截,返工的代价永远比多问几句话贵。唯一要注意的是这依赖 Claude 主动提问的意愿,如果 effort 没调高、模式没设对,它大概率会直接开始干活而不是先问——这一点 Arno 后面提到了,但很容易被忽略。 **图解 17**: 把验证前移到产物里:Agent 自己就能知道有没有走偏 (适合:工程师向) 长任务跑偏的代价很大,所以要在**任务开始前就把方向、验证和反馈通道布好**。这条链的关键是第三步:让组件把关键状态发布到 DOM,形成一份**公开的合同**,Agent 于是能直接读取真实结果自己验证,不必抓页面、不必猜内部状态。下半部分是这套做法的核心区分——**test 问的是代码能不能过,verify 问的是产物能不能被检查**。多花的那点 token,换的是少返工。 ### 验证前移到产物:DOM 合同 + 三条路径——这是全篇的核心,我完全站在 Arno 这边 视频最有价值的部分是 verification framework。Arno 区分 test 和 verify:**测试关注代码能否通过,验证关注产物能否被人和 Agent 原生检查**。在 React to-do app 里,组件把 total、done、active 发布到 DOM,Agent 直接读公开的 DOM contract 运行验证,不必 scrape 页面、不必猜内部状态。 test 和 verify 这个区分我认为讲透了一个长期被混用的概念:单测通过只证明代码逻辑符合你写的断言,不证明产物本身对不对。这也是为什么很多团队「测试全绿、上线出问题」——他们验证的是代码,没验证产物。Arno 给的解法很朴素,就是让产物自己暴露状态,这一点没有任何理论门槛,任何前端项目现在就能抄。 > 让验证原生存在于事物本身,这样 Agent 可以和人一起驱动它。 — — Arno, Anthropic 每个组件带 schema、fixtures、known states 和 invariants。Arno 故意写一条"3 + 4 不等于 10"的 invariant:普通测试能通过,**但 verification dashboard 会毫不留情把失败暴露出来**。同一套验证给三个表面用:人看的 dashboard、Agent 从浏览器驱动的方式、CI 里 headless 跑的命令,**三者围绕同一份 manifest、同一批 probes、同一组 invariants 工作**。 > 可以用人类可读的方式验证,也可以用 Agent-first 的方式验证,还可以 headless 地跑。 — — Arno, Anthropic 他强调 probes 要能推离 happy path:只验证顺利路径,Agent 很容易给出看似漂亮、实际脆弱的结果。边界、错误、不一致状态都要能运行验证。 ### 证据自动留下,让多花 token 换少返工 验证只告诉 pass/fail 还不够。Arno 现场演示 recording:验证步骤可以被录成 clips,打包下载、放 S3、分享。**当 Agent 提交越来越多代码,验证记录会变成团队信任它的基础设施**。 > 你可以下载全部 clips,它们就是证明验证跑过的 bundle。 — — Arno, Anthropic HTML spec 单次生成可能更贵,**但规格更丰富、更好读、更容易截图反馈,长期会少迭代很多轮**。会用 Claude Code 的团队,差距会从"谁更会写 prompt"转向"谁更会设计 Agent 可以工作的环境"——context files、commands、hooks、subagents 共同组成这套环境。这个判断我认同,但想补一句:这个结论对个人开发者的适用性要打折扣,「设计 Agent 环境」本身需要工程投入,团队规模够大才能把这笔投入摊薄,独立开发者更现实的策略还是先把 test/verify 这条分清楚,再谈环境设计。 #### Arno 演示了什么 - 让 Claude 先采访你,再开始写需求 - HTML 规格稿代替长文档,可看、可点、可截图 - DOM 合同:组件把状态公开,Agent 直接读取验证 - 同一套验证给人、Agent、CI 三条路径用 #### 原视频 观看 Arno 的完整 workshop 演示,了解 Anthropic 工程师如何将 Claude Code 融入工程闭环。 [▶ 观看 Workshop](https://www.youtube.com/watch?v=IlqJqcl8ONE) #### 我的评论 - 这是六篇里唯一给出具体可抄实现的一篇,含金量最高 - test/verify 的区分讲透了「测试全绿但产物出问题」的根源 - 反过来采访你,本质是把返工成本提前拦截,性价比很高 - 「设计 Agent 环境」的投入门槛偏高,独立开发者优先级应靠后 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 → 很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。](https://usefulai.cloud/insights/claude-skill-not-longer-prompt/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-skill-not-longer-prompt/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Anthropic Claude Code Skill MCP # Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务 很多人第一次写 Skill,会下意识地写成一个更长的 Prompt,把背景、规则、注意事项、示例全都塞进去。看起来很完整,但实际并不好用。Anthropic 官方给出的答案是:Skill 的价值在于让 Agent 自动识别场景、加载流程、使用合适工具,并稳定完成任务。我基本认同这套方法论,但也想指出它回避了一个不小的成本问题。 **我的立场:**这篇官方最佳实践里,渐进式披露和最小权限两条我完全认同,是实打实能落地的工程原则。但「验证 + 打分 + 基线对比」这套流程说起来轻巧,真正照做的团队成本不低——文档里没有正面回答这笔账划不划算,这也是我认为整套方法论里最薄弱的一环。 ### Skill 是可复用的工作流,不是更长的 Prompt Prompt 是一次性指令,Skill 是**可复用、自主触发、可维护、可进化**的工作流。官方用厨房比喻:MCP 提供「专业厨房」——通向 Notion、飞书等服务的接口;Skill 提供「食谱」——告诉 AI 怎么用工具做出有价值的东西。**MCP 决定 AI 能做什么,Skill 决定 AI 该怎么做。**这个比喻我认为是这篇文档里最清晰的一句话,比后面大段的规则条目都更能一次讲明白两者的分工。 ### 动手之前,先定 2-3 个具体用例 先回答四个问题:用户想完成什么?需要哪些多步流程?需要哪些工具?应该嵌入哪些领域知识?每个用例写清四件事——**用例、触发、步骤、结果**。定不出 2-3 个具体用例,说明你需要的可能只是一段 Prompt。 Anthropic 把 Skill 归成三类:**文档与资源创建**(重点是质量检查和模板结构)、**工作流自动化**(重点是步骤衔接和关卡验证)、**MCP 增强**(服务提供方写给用户的「怎么用」说明书)。开工前想清自己在哪一类,写法重点完全不同。 ### 按需加载:Description 决定成败 Skill 的特点是 **on-demand loading(按需加载)**——平时不会把整个 SKILL.md 塞进上下文,只有当用户输入与 description 匹配时才加载。关键细节:Skill 正文不常驻,但 **description 会长期参与匹配**,直接决定 Skill 会不会被正确触发。Anthropic 公式:**[做什么] + [什么时候用] + [关键能力]**,不超 1024 字符,必须用第三人称。 > 好的描述示例:拆解小红书爆款笔记的封面、标题、开头、结构、关键词,输出可复用的模板。当用户说「拆解一下这条笔记」、「分析这个爆款」,或贴一条小红书链接时,使用这个 skill。 — — Anthropic Skill 最佳实践 ### 最小权限 + 匹配合适模型 核心原则:**只给完成任务所需的最小权限**。不要让只负责生成建议的 Skill 默认能修改文件,甚至可以细致到子命令级别——发布文章的 Skill 只允许跑发布脚本,不能动其他文件。不同任务对模型要求不同:写文档用写作强的;数据分析用推理不错但便宜的;信息爬取用快而便宜的。配合 effort 字段控制思考深度:简单任务低思考省钱,复杂决策高思考换准确率。 **图解 15**: 渐进式披露:Skill 的三级加载,各级付的成本不同 (适合:工程师向) Skill 好不好用,一半取决于**你把哪些内容放在哪一级**。**description 是唯一常驻的部分**,所以它既是触发开关也是持续成本;**SKILL.md 只在匹配后加载**,超过 500 行通常意味着该拆;**大段模板与脚本应该沉到第三级**,按需读取。做这个分层不只为省钱,更是为了不让关键指令被淹没在过长的上下文里。 ### 渐进式披露:SKILL.md 不承载所有内容 这是最容易被忽略的原则。三级加载:**Description**(始终加载)→ **SKILL.md 正文**(匹配时加载)→ **捆绑文件**(按需读取,放在 references/、scripts/、assets/)。SKILL.md 建议 500 行以内——超过通常说明你把太多东西混在一起,拆完还长可能说明这不是一个 Skill 而是几个。 > 渐进式披露的目的是「在保持专业知识的同时,最小化 token 用量」。省钱看得见,省上下文空间看不见——但长对话里后者影响更大。 — — Anthropic 官方文档 两个原因:**省 token**(一个月几万次调用就是真金白银的 API 账单)与**省上下文空间**——内容太多会挤占对话历史、埋没关键指令(「中段迷失」)、触发自动压缩导致模型表现下降。 ### 写完必须验证、打分、迭代——但这笔账没那么好算 Skill 写完不代表能用。至少做三类验证:**能不能跑**、**能不能正确触发**(该触发的触发、不该触发的不触发)、**结果是否比不用 Skill 更好**——最容易被忽略的一点。每个用例 0-10 分打分,主要测试至少 5 分以上。想更专业可以做**基线对比**:同一个测试跑两次,7 分变 7 分说明没增益,4 分变 8 分才说明经验真正被固化了。 评论员视角 这套验证流程本身没有问题,我质疑的是它被轻描淡写地放在文末,像是「顺手做一下」的收尾动作。事实是:定 2-3 个用例、写触发测试、做 0-10 打分、再做基线对比——这四步做完的工作量,很可能超过写 SKILL.md 正文本身。文档全篇在教你怎么写好一个 Skill,却没有给出一个粗略的判断标准:什么规模的重复任务,值得付出这套验证成本? 我的判断是这样算账的:如果这个任务你一周只做一次,手写 Prompt 反而更便宜;只有当同一个流程要被反复调用几十次以上,验证成本才能被摊薄。文档把 Skill 的适用范围讲得很宽,但没有讲清楚这条成本线在哪里,这是我认为整篇最佳实践里最该补上的一块。 #### 核心观点 - Skill 是可复用的工作流,不是更长的 Prompt - MCP 决定能做什么,Skill 决定该怎么做 - Description 是 Skill 的灵魂,写好三段公式 - 渐进式披露:省 token、省上下文、保模型表现 - 写完必须验证、打分、迭代——不能只靠感觉 #### Skill 速查清单 - 定 2-3 个具体用例(用例 / 触发 / 步骤 / 结果) - 判断类别:文档创建 / 工作流 / MCP 增强 - Description = 做什么 + 什么时候用 + 关键能力 - SKILL.md ≤ 500 行,详细内容拆到子目录 - 工具最小权限 + 匹配合适模型 - 触发测试 + 质量打分 + 基线对比 #### 我持保留意见的地方 - 验证 + 打分 + 基线对比这套流程的人力成本被低估了 - 文档没给出「值不值得写 Skill」的调用频次门槛 - 低频任务上,手写 Prompt 可能比养一个 Skill 更省事 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-beyond-basics/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Daisy Holman Claude Code Team Workflow # Claude Code:基础用法之外,Agent 要进团队工作流 Daisy Holman 是 Claude Code 团队工程师,早期参与 Claude Code、plugins 和 agent teams 相关工作。她这次没有讲"怎么让 Claude Code 写一个小功能",而是把问题放到更硬的现场:几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。这篇里我认为「上下文窗口是预算」的比喻是全场最实用的一个框架,它把一堆零散的工具选型问题,收进了同一套记账逻辑。 ### 从编程任务到工程任务 Daisy 开场把边界划清:Claude Code 对简单编程任务已经够顺手,零到一项目都能推进。但团队里的软件工程很快会遇到另一套现实——**代码有债务,功能有上下游,改动要满足产品、合规、运维、客户等一串外部约束**。 > Claude Code 对很简单的编程任务开箱可用;但复杂度上来、靠近软件工程任务时,你需要给它一些旋钮和定制。 — — Daisy Holman **我的看法:**这个边界划得很准。行业里常见的说法是「Claude Code 能不能干工程活」,这其实是个假问题——它一直都能,只是「开箱可用」和「靠旋钮撑起来」是两种完全不同的成本结构,前者几乎零配置,后者需要专门投入设计上下文、权限和验证。Daisy 后面讲的全部内容,本质都是在给这句话填细节。 ### 把 Agent 当同事,接触同事的信息 工程判断很少只藏在源码里:API 为什么不能改可能写在设计文档,边界为什么保留可能来自 Slack 线程,事故处理方式可能在 runbook 和会议纪要里。 > 专业软件工程里的大部分工作并不在实际源码里。我们写设计文档,写邮件,也在 Slack 上讨论。 — — Daisy Holman Daisy 的建议朴素但可执行:**把 Agent 当同事,就要让它接触同事能接触的信息**。试着用 Claude Code 完成一整天工作,每一次不得不切到别的工具复制信息,都说明 Agent 缺了一块工作现场。 她甚至建议会议刚结束就把纪要喂给 Claude,一场会议后能拿到两三个 PR。这个建议我认同方向,但要提一个现实的顾虑:会议纪要里往往混着敏感信息(薪资讨论、人事变动、未公开的商业决定),把这些无差别喂给 Agent,等于扩大了敏感信息的暴露面。Daisy 没有在演讲里提到访问控制或信息分级,这是我认为「把 Agent 当同事」这个类比里被回避的部分——同事之间也不是无条件互相看所有信息的。 ### 上下文窗口:MCP、Skill、Hooks 的 token 账——这是全篇最扎实的部分 定制问题拉回一个基础约束:**上下文窗口的上限并没有以模型能力同样的速度扩张**。她比喻为"在 Arduino 上跑 NPM"——空间小但信息多,工程问题变成包装与加载:哪些常驻、哪些按需读取、哪些压缩成最小版本。 > 你不能把整个代码库、整个 wiki、所有内部文档都塞进上下文窗口。你需要在正确时间放入正确信息。 — — Daisy Holman **MCP 适合向外集成,内部流程先看 CLI + skill**。Claude Code 本身有 shell,把内部部署脚本重新封成 MCP server 维护成本很快上来;MCP 工具的名字、描述、schema 都要进入系统提示词——20 个 server × 15 个 tool,窗口很快就被工具定义塞满。 Skill 虽轻,但 description 永远会被加载,触发规则写 300-400 tokens 才可靠时,十万份叠起来就不再轻。Daisy 明显更看重 **hooks**:在 Agent 循环外触发本机程序做类型检查、lint、诊断。 > 它在上下文窗口外运行,所以没有 token 成本。你不为没有用到的东西付费。 — — Daisy Holman 取舍原则:**把稀缺资源从 context window 移到更宽裕的本机计算上**。而**耐用的信息靠前,临时内容靠后**——位置本身就是内存布局。这条我完全认同,而且我认为它比「MCP vs Skill 怎么选」的具体建议更有长期价值:具体建议会随模型窗口变大而过时,但「稀缺资源要精打细算地分配」这条原则不会过时,窗口再大,总有更贵的东西想往里塞。 **图解 18**: 上下文窗口是一份预算:MCP、Skill、Hooks 都在从同一个池子里扣 (适合:工程师向) 模型能力涨得比上下文窗口快,所以窗口是**真正的稀缺资源**——Daisy 的比喻是「在 Arduino 上跑 NPM」。这张图想说清一件事:**MCP 工具定义、Skill、Hooks 输出、代码文件、对话历史都在从同一个池子里扣**,扣完剩下的才是留给推理的余量。所以工程问题变成了包装与加载:哪些常驻、哪些按需读、哪些压成最小版本;**耐用的信息靠前,临时的靠后**,位置本身就是内存布局。 ### 异步与并行:Agent 可以过夜工作——这里我想提一句风险 团队另两个主题是**异步与并行**:异步意味着走开让 Agent 继续,并行意味着同时让多个 Agent 推进不同分支。工程师从八小时 flow state 变成更像调度中心的一天。 > 如果你想做高质量、高效率的工程,你的工作日很可能不会再长成过去那样。 — — Daisy Holman 基础做法是 **worktrees**:为不同 Agent 保留长期工作树,避免重复初始化;每个 Agent 维持自己的身份、分支和上下文,再通过消息工具互相传递。 托起异步与并行的是权限与监控:Auto Mode 背后有 classifier agent 与对抗式检查工具调用的另一个 agent。 > 这基本上就是不再有权限提示。它让 loop 可用,让 agent teams 可用,也让过夜工作可用。 — — Daisy Holman Cloud agents 开发者过去一个月推进了大约一千个 PR——**软件工程的杠杆,正在变成"能否安全地让一群 Agent 持续推进"**。 一千个 PR 这个数字听起来惊人,但我想问一句没被问到的问题:这一千个 PR 里有多少被合并、多少被 review 打回、多少是重复劳动?「能否安全地让 Agent 持续推进」这句话把安全的判断标准放在了「能不能过夜跑」,我认为更该放在「过夜跑完之后,需要几个人花几小时清理」。产出数量和产出质量在这类叙事里经常被悄悄画上等号,而这正是这篇演讲和第三篇 Boris/Cat 访谈共同的盲区。 #### Daisy 说了什么 - 编程任务开箱可用,工程任务需要旋钮和定制 - 把 Agent 当同事,让它接触同事能接触的信息 - 上下文窗口是硬边界,需要设计"内存布局" - 异步 + 并行,Agent 可以过夜推进上千个 PR #### 原视频 观看 Daisy Holman 讲解如何让 Claude Code 进入团队级工程系统。 [▶ 观看演讲](https://www.youtube.com/watch?v=tuY2ChJIx48) #### 我的评论 - 「上下文窗口是预算」是全场最耐用的框架,比具体工具选型更长寿 - 把会议纪要无差别喂给 Agent,回避了信息分级和访问控制问题 - 一千个 PR 的产出数字,没说清楚有多少最终真正被合并 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-one-year/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) Claude Boris Cherny Cat Wu Agent # Claude Code 一周年复盘:工程师开始指挥 Agent 队伍 Claude Code 发布一周年,Anthropic 找来负责人 Boris Cherny 和产品负责人 Cat Wu 复盘。这期访谈信息密度很高,我认为其中最值钱的一条不是「Agent 树」的规模叙事,而是一个不起眼的小习惯:把每次犯错写回 CLAUDE.md。规模的故事听起来更振奋,但决定这套系统能不能长期跑下去的,恰恰是这个容易被忽略的细节。 ### 从单 Agent 到 Agent 队伍:这段叙事我持怀疑态度 一年前 Boris 把 demo 发到 Slack,只有两个人点反应,Cat 委婉地说"简单任务还不错"。一年后,Boris 不再只和一个 Agent 对话,而是让 Agent 提示 Agent,分叉成一棵上千节点的树。控制台从"我写代码"变成"**调度一群会写代码的执行者**"。 > 现在我有一支 Agent 军队在做事,一个 Agent 提示另一个 Agent,像一棵有上千个 Agent 的树。 — — Boris Cherny **我的看法:**「上千节点的 Agent 树」这个数字很抓耳朵,但我觉得它更适合当发布会金句,不适合当能力指标。节点数量本身不代表任何产出质量——一千个 Agent 里如果有一半在重复犯同一个错,规模反而是负债。真正值得记录的信息藏在下一段,Boris 自己也承认了这一点:让规模真正有意义的,不是树有多大,而是错误有没有被写回去。 **图解 16**: 从一个 Agent 到一棵 Agent 树,以及让经验留下来的那个回路 (适合:工程师向) 左边是规模的变化,右边才是关键:**Agent 犯错时不要只说「下次别这样」,而是让它把新规则写回 CLAUDE.md 或沉淀成 skill**。这一步把一次性的纠错变成**下一轮 Agent 能继承的组织记忆**——工具用一次,经验留一层。规模能撑起来的前提是这个回路真的在转,否则一千个节点只是把同一个错误犯一千遍。 ### 错误写回 + 真实运行验证:这才是全篇真正的干货 Boris 的核心习惯:Claude 每次犯错,不告诉它"下次别这样",而是让它把新规则写进 CLAUDE.md 或沉淀成 skill。**同一个错误变成下一轮 Agent 能继承的组织记忆**,工具用一次,经验留一层。 我把这条排在全篇第一,是因为它是唯一一个「不需要相信 Anthropic 的规模叙事」就能直接照搬的方法——不管你手上是一个 Agent 还是一千个,这个习惯都成立,而且成本几乎为零。相比之下,前面「Agent 树」的故事更依赖 Anthropic 的资源和场景,普通团队复制起来门槛高得多。 > 每次 Claude 犯错,我不会告诉它下次别这样;我会让它写进 CLAUDE.md,或者做成一个技能。 — — Boris Cherny 验证也要往前走:不是单测、lint,而是**真的跑起来、触发功能、看到出错再修复**。验证能力直接决定授权范围——能跑起环境、复测边界的 Agent,才值得把注意力节省下来。 ### Everyone codes 与 Routines:听起来很美,但我想问一句谁在兜底 Anthropic 内部最有冲击感的变化是 **everyone codes**:PM、设计师、财务都在 Claude Code 里直接改系统,卡在排期里的改动开始被离用户最近的人直接推动。 > Claude 写代码后,更重要的是你有什么想法;有产品、业务、设计和用户上下文,你会提出更好的想法。 — — Cat Wu Cat 最兴奋的是 **routines**:监听所有 ticket、GitHub issue、bug report,Claude 主动捡起来修、开 PR、再 ping 给他。入口每上移一层,人从执行细节里再释放一层——技能之上,真正稀缺的是想法。 但这里我想追问一句这次访谈没问的:PM 和财务写的代码,谁来 review?谁为线上事故负责?Cat 说的是「有产品、业务、用户上下文的人会提出更好的想法」,这句话本身没错,但「提出好想法」和「对改动的后果负责」是两件不同的事,访谈把它们悄悄划了等号。如果没有一个明确的责任归属机制,everyone codes 很容易变成「everyone commits,few own」。 ### Auto Mode 与 Context Minimalism:这条我完全同意 Boris 现在最常用 **Auto Mode**:不再盯每一步工具调用,启一个 Claude 就转去下一个。团队认为反而更安全——不会被"几乎都该点 yes"的请求淹没,注意力得以精确分配。 > 当你会接受 99% 的请求时,人的眼睛会自然失焦;Auto Mode 让你只关注最重要的那一小部分。 — — Boris Cherny Boris 与 Cat 都是 **context minimalist**:只给最少的 system prompt 和工具,再给一种拉取上下文的方式,让模型自己完成探索。不要把 Agent 当助手放在流程旁边——**要让流程本身围着它重排**。这条我没有异议,「注意力精确分配」和「让流程围着 Agent 重排」是这篇访谈里少数经得起推敲、且跟公司规模无关的通用建议。 #### Anthropic 说了什么 - 从单 Agent 对话到上千个 Agent 的树 - 每次犯错写回 CLAUDE.md 或 Skill - PM、设计师、财务都在写代码——"everyone codes" - Routine 自动监听 Issue 并开 PR #### 原视频 观看 Boris Cherny 与 Cat Wu 的完整一周年复盘,了解 Agent 如何进入组织流程。 [▶ 观看复盘](https://www.youtube.com/watch?v=Hth_tLaC2j8) #### 我的评论 - 「上千节点 Agent 树」是抓耳朵的数字,不是能力指标 - 错误写回 CLAUDE.md 才是真正可复制的方法,成本几乎为零 - Everyone codes 没回答清楚:谁为改动的后果负责 - Context minimalism 这条我完全认同,跟公司规模无关 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/) --- > 来源:Useful AI Lab(实用 AI / Useful AI)— https://usefulai.cloud/insights/claude-code-boris-cherny/ > 作者:CarryChang · 最近更新:2026-07-30 · 语言:zh-CN [实用 AI 指南](https://usefulai.cloud/) › [深度阅读](https://usefulai.cloud/insights/) 机器之心 Boris Cherny Claude Code Anthropic # Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么? 很多人说,在 AI 时代,品味是人类最后的护城河。Boris Cherny——Anthropic 技术成员、Claude Code 核心建设者之一——不这么认为,他看到的趋势是「品味」也在被模型快速学会。我看完这段访谈只同意一半:他给出的全部证据都来自代码这种能被编译器和测试直接判错的领域,这恰恰是「品味可以被学会」的前提,不是能随便套用到别的地方的结论。 **我的立场:**Boris 说品味会被侵蚀,我认为这个判断的适用边界比他说的窄——只在「能验证」的领域成立。代码能编译、能跑测试,所以模型学品味有反馈信号可以抓;审美、战略、人情世故这类判断至今没有这种信号,说它们也会被同样的速度侵蚀,是把一个领域的观察硬套到另一个领域,逻辑上跳了一步。下文我会标出哪些地方我认同、哪些地方我觉得他把话说得太满。 ### Coding Agent 的诞生:从辅助到主体 2024 年底 Boris 加入 Anthropic Labs Team 探索未来产品形态。当时团队感受强烈:**模型能力已远超现有产品**。市面上 AI 编程工具停留在自动补全和问答助手,还没有真正的 Coding Agent。于是团队决定更激进——不再把模型当辅助,而是直接变成开发主体。Boris 坦率承认,最初的 Claude Code 只能完成他 10%-20% 的工作,与今天完全不是同一个东西。 Anthropic 之所以重视 Coding,是因为它是 AI Safety 近乎理想的实验场:代码能不能跑、测试过不过反馈极清晰,互联网又提供海量训练数据。**Claude Code 从来不只是生产力工具,也是理解未来 AI 系统的实验平台。** ### 能力跃迁的唯一原因:模型变强了 Boris 的回答异常简单:真正带来跃迁的原因只有一个——**模型变强了**。产品功能、Plan Mode、多端扩展都是增量改进;决定上限的是底层模型本身。从 Sonnet 4、Opus 4 到 Opus 4.5,每次模型提升都直接反映在 Claude Code 表现上。 > Claude Code 在公司内部广泛使用之后,每位工程师产出的代码量增长了大约三倍——而且这已经是过时的数据。 — — Boris Cherny 更有意思的是,公司规模扩张时新工程师熟悉内部系统的时间从数周缩短到两天——原因不是培训体系革命,而是大家习惯直接问 Claude。**越来越多隐性知识被转移到 Agent 身上,压缩了组织知识传递的成本。** **图解 14**: 抽象层级又升了一层:从写代码到写 Loops (适合:工程师向) 这张图的重点不是「工程师被替代」,而是**人负责的那一层一直在往上移**:从亲手执行 → 判断对不对 → 设计让别人(Agent)去执行的循环。Boris 去年十一月卸载了 IDE,同时跑 5-10 个 Claude 实例。值得注意的是这条曲线在历史上出现过很多次——**每次抽象层级提升,都会有人说这已经不算真正的编程**。 ### 从写代码到写 Loops:这次不只是「抽象层级又升一层」 上面这张图已经把三个阶段摆清楚了,我不重复。我想指出一个被「历史总会重演」这句话悄悄带过的差异:**穿孔卡到汇编到高级语言,每一层抽象升级之后,人依然是唯一的决策源**——编译器不会自己决定编译成什么样的程序。写 Loops 不是这样:循环边界之内具体怎么做,是模型在当场决定。这是「提高抽象层级」和「转移部分决策权」的区别,Boris 的类比把两者混为一谈了。 > 我的工作已经变成写 Loops。过去是人向 Claude 下达指令,现在则是程序替我向 Claude 下达指令。 — — Boris Cherny 这句话本身没问题,但我更在意背后没说出来的那句:程序替他下指令,那「程序」下得对不对,谁来验证?访谈里没有回答这个问题,我认为这是这篇访谈最大的留白——把决策权交出去很容易讲成故事,把验证责任交出去才是真正的风险敞口。 ### 通才的黄金时代:这个结论我持保留态度 Claude Code 团队最喜欢 **Generalist(通才)**:工程师直接和用户沟通、做设计、拉数据,设计师和财务也在写代码。Boris 把这解读成「AI 改变了知识与执行的关系」。 我看到的是另一种更平淡的解释:Claude Code 是一个几十人规模、高密度人才、产品还在快速迭代期的团队——这种团队本来就偏爱通才,跟有没有 AI 关系不大,硅谷早期创业公司二十年来都这么招人。Boris 把「小团队偏爱通才」包装成「AI 时代的招聘趋势」,中间那段因果没交代清楚:是 AI 让通才变得更值钱,还是 Claude Code 本来就是通才扎堆的地方,恰好又高强度地用 AI?两种解释都能说明他看到的现象,他选了对自己叙事更有利的那一个。 ### 品味也会被侵蚀,最终剩下的是价值观——我认为这个论证有个漏洞 Boris 很坦诚:他曾坚持代码库不准用 class 只准 function,后来模型大规模写 class,他看了半天说也许模型是对的。他推断产品品味这道「最后的 alpha」也在快速消失——几百个 Claude 实例正在同时刷 Twitter、看 issue、分析该做什么功能,目前约 20% 想法是好的,他预计 3-6 个月后大部分会是好的。 **这里我要挑一个逻辑漏洞。**「20% 好想法会在 3-6 个月后变成大部分好」是一句当下既无法证明也无法反驳的预测,本质是信念表态,不是数据。代码品味能被模型学会,前提是「好不好」有清晰又快速的反馈:能不能跑、能不能通过 review、有没有 bug。产品方向的「好不好」往往要等数月甚至更久才能被市场验证,反馈周期长到根本套不进同一套强化学习逻辑。Boris 把两种反馈速度完全不同的「品味」混在一起讨论,这也是我认为他的核心论点站不住的地方。 人类最终还剩下什么?他的答案是价值观。这个答案很动人,但我想追问一句:如果品味会被侵蚀是因为它「有反馈信号」,那价值观凭什么例外?人的价值观同样是被外部反馈(教育、社会奖惩、代际经验)塑造出来的,只是反馈周期以年甚至以代际计算。价值观没有被侵蚀,未必因为它是什么特殊的护城河,更可能只是因为它的反馈周期远比模型的迭代速度长——这更像「暂时安全」,不是「本质安全」。这个区分很重要:如果 Anthropic 真的把宪法式训练之类的方法用在价值观对齐上,价值观这道护城河被侵蚀的速度,可能比 Boris 预期的快得多。 #### Boris 说了什么 - 能力跃迁只来自模型变强,不是产品技巧 - 工作方式从写代码 → 审查 → 设计 Loops - Claude Code 团队最偏爱通才 - 产品品味也在被模型侵蚀,价值观是最后的护城河 #### 原视频 观看 Boris Cherny 完整访谈,了解 AI 如何改变工作方式。 [▶ 观看访谈](https://www.youtube.com/watch?v=RkQQ7WEor7w&t=1s) #### 我不认同的地方 - 写 Loops 转移的是决策权,不只是抽象层级——两者不是一回事 - 「通才受青睐」更可能是小团队特征,被包装成了 AI 时代趋势 - 产品品味的反馈周期远比代码长,套用同一套「会被侵蚀」的逻辑站不住 - 价值观没被侵蚀,可能只是反馈周期更长,不是天生安全 ## 继续阅读 [如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线 → 所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。](https://usefulai.cloud/insights/how-llms-are-built/) [Anthropic 工程师:我们日常如何使用 Claude Code → 用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。](https://usefulai.cloud/insights/anthropic-how-we-use-claude-code/) [深度阅读 → 6 篇 AI 长文的完整中文解读:Claude Code、Skill、Agent、大模型原理。](https://usefulai.cloud/insights/)