实用 AI 指南 › 深度阅读

Deep Read

深度阅读:值得读完的 15 篇 AI 长文

关于 AI 如何改变工作方式、以及如何让 AI 稳定执行复杂任务的 15 篇长文。都是我读完后的完整中文解读与判断,不是摘要拼接——如果你只读一篇,从大模型的 5 阶段构建流水线开始。

最近更新:2026-09-13 · 作者:UsefulAI

共 15 篇 · 合计约 95 分钟

只读一篇的话,从这篇开始

如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线

所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。

后面几篇讲的都是「怎么用」「怎么判断」,这一篇讲「它为什么是这样」。先有这条骨架,其余内容才不会停留在技巧层面。

X / Twitter · Khairallah AL-Awady 约 12 分钟 LLM5 阶段流水线 读全文 →

Claude Code、Agent、机器人与行业判断

按阅读顺序排列:先看一个人怎么用,再看怎么把流程固定下来,然后是团队与组织层面会遇到什么,接着是怎么从一份庞杂的资源清单里看出技术地图;后半段跳出 Claude Code 生态——机器人数据采集、3D 操作与安全优先级的精度工程,AI 编程被忽略的成本平移,版权判决与 Scaling Law 这两个行业叙事该怎么读,以及 Agent Harness 自我改进的冷思考与 OpenAI 全球使用数据背后的真实分布。

  1. 01 约 6 分钟
    Claude · Arno(Applied AI)

    Anthropic 工程师:我们日常如何使用 Claude Code

    用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。

    VerificationWorkshop 读全文 →
  2. 02 约 6 分钟
    Anthropic · Claude Code

    Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务

    很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。

    SkillMCP 读全文 →
  3. 03 约 7 分钟
    Claude · Daisy Holman

    Claude Code:基础用法之外,Agent 要进团队工作流

    几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。

    Team WorkflowContext 读全文 →
  4. 04 约 5 分钟
    Claude · Boris Cherny & Cat Wu

    Claude Code 一周年复盘:工程师开始指挥 Agent 队伍

    当 Agent 能运行、能验证、能写回经验,人的工作会从亲手执行转向设计循环、挑选想法和守住边界。

    AgentClaude Code 读全文 →
  5. 05 约 7 分钟
    机器之心 · Boris Cherny

    Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么?

    很多人说在 AI 时代品味是人类最后的护城河,但 Boris Cherny 不这么认为——他看到的趋势是所谓「品味」也在被模型快速学会。

    Claude CodeAnthropic 读全文 →
  6. 06 约 8 分钟
    GitHub · WangRongsheng

    拆解一份 500+ 条目的 LLM 资源清单:怎么从「大而全」里看出技术地图

    一份跨近 30 个分类、条目早已过千的 LLM 资源清单,真正的价值不在「资源全」,而在用条目密度反推出每个技术方向现在有多拥挤。

    资源清单技术地图 读全文 →
  7. 07 约 6 分钟
    公众号 · UsefulAI

    把机器人数据采集精度干到 3 毫米:HiFi-UMI 昂贵的遥操作数据变得可有可无?

    HiFi-UMI 用采集装置改造、传感器融合、仿真真机数据打通的组合方案把抓取精度做到 3 毫米级别,但这提升的是数据利用效率,不等于遥操作采集这个环节变得不重要。

    机器人操作Sim2Real 读全文 →
  8. 08 约 6 分钟
    公众号 · UsefulAI

    「任何人都能用 AI 编程」:被忽略的成本平移

    AI 降低的是写代码的门槛,没有降低判断代码对不对的门槛。成本没有消失,只是从「写」平移到了「审」和「返工」,验证力弱的人风险会被推迟兑现。

    AI编程成本结构 读全文 →
  9. 09 约 5 分钟
    公众号 · UsefulAI

    我们可能误读了 Anthropic 的「销毁书籍」:它争的从来不是版权,是知识的解释权

    法官把「用书训练」和「书从哪来」拆成两件事判——训练本身是合理使用,但留存盗版副本不受保护。真正的赌注是谁有权决定内容进入训练管线的正当路径。

    版权Bartz v. Anthropic 读全文 →
  10. 10 约 5 分钟
    公众号 · UsefulAI

    Scaling Law 不是物理定律,是「外推幻觉」

    Scaling Law 是对已观测数据的经验拟合,不是物理定律。拟合得好不等于可以无限外推,把经验规律包装成「定律」的确定性语气,背后还有资本叙事的需要。

    Scaling Law外推 读全文 →
  11. 11 约 5 分钟
    公众号 · UsefulAI

    一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法

    冻住基座模型,只加一个约 9.2% 开销的记忆模块,把记忆依赖型任务成功率从 18.9% 拉到 96.0%。不靠堆大模型,靠精准打补丁解决 3D 操作的老大难。

    机器人操作VLA 读全文 →
  12. 12 约 6 分钟
    公众号 · UsefulAI

    当所有人都在聊 Harness 能"自我改进"时,我想泼一盆冷水

    AHE 让 Agent 自动修 Harness,10 轮迭代跑赢人工设计版本。但论文自己的数据显示回归预测几乎是瞎猜,这个"回归盲区"才是判断它算不算真正自我改进的关键。

    Agent Harness自我改进 读全文 →
  13. 13 约 5 分钟
    公众号 · UsefulAI

    OpenAI 第一次把家底摊开:全球都在用 ChatGPT,但用在了不同的事上

    Asking、Doing、Expressing 三分法显示,近半数 ChatGPT 使用价值在"想清楚"而非"做完"。约七成使用与工作无关,低收入国家采用增速是高收入国家 4 倍以上。

    OpenAIChatGPT 读全文 →
  14. 14 约 6 分钟
    公众号 · UsefulAI

    Google 用 ER 2 做了一件「不酷」的事,但可能做对了

    安全指令遵循准确率从 47.2% 跳到 97.9%,提升幅度远超任何能力型指标。在行业普遍追求"能做什么"的氛围下,把最大投入放在拍不出演示视频的安全性上,可能是对的。

    Gemini Robotics安全性 读全文 →