实用 AI 指南 › 深度阅读
Deep Read
深度阅读:值得读完的 15 篇 AI 长文
关于 AI 如何改变工作方式、以及如何让 AI 稳定执行复杂任务的 15 篇长文。都是我读完后的完整中文解读与判断,不是摘要拼接——如果你只读一篇,从大模型的 5 阶段构建流水线开始。
共 15 篇 · 合计约 95 分钟
只读一篇的话,从这篇开始如何从零构建你自己的大语言模型:GPT 和 Claude 背后的 5 阶段流水线
所有前沿模型都由同样的五个阶段构建:数据 → 预训练 → 监督微调 → 奖励建模 → 强化学习。学会这套骨架,你就不会再把模型当作魔法。
后面几篇讲的都是「怎么用」「怎么判断」,这一篇讲「它为什么是这样」。先有这条骨架,其余内容才不会停留在技巧层面。
Claude Code、Agent、机器人与行业判断
按阅读顺序排列:先看一个人怎么用,再看怎么把流程固定下来,然后是团队与组织层面会遇到什么,接着是怎么从一份庞杂的资源清单里看出技术地图;后半段跳出 Claude Code 生态——机器人数据采集、3D 操作与安全优先级的精度工程,AI 编程被忽略的成本平移,版权判决与 Scaling Law 这两个行业叙事该怎么读,以及 Agent Harness 自我改进的冷思考与 OpenAI 全球使用数据背后的真实分布。
-
01 约 6 分钟
Anthropic 工程师:我们日常如何使用 Claude Code
用一个真实 repo 演示 Anthropic 工程师怎样配置 Claude Code、让它问问题、生成 HTML 规格稿,再把验证流程做进 React 组件和浏览器。
VerificationWorkshop 读全文 → -
02 约 6 分钟
Skill 不是更长的 Prompt——如何让 AI 按流程稳定完成复杂任务
很多人第一次写 Skill 会写成一个更长的 Prompt,看起来完整但并不好用。Skill 真正的价值是让 Agent 自动识别场景、加载流程、稳定完成任务。
SkillMCP 读全文 → -
03 约 7 分钟
Claude Code:基础用法之外,Agent 要进团队工作流
几百、几千甚至上万名工程师共用一个代码库时,Agent 怎样才能进入真实工程系统。
Team WorkflowContext 读全文 → -
04 约 5 分钟
Claude Code 一周年复盘:工程师开始指挥 Agent 队伍
当 Agent 能运行、能验证、能写回经验,人的工作会从亲手执行转向设计循环、挑选想法和守住边界。
AgentClaude Code 读全文 → -
05 约 7 分钟
Claude Code 之父:「品味」不是人类护城河;当工程师不再写代码,招聘看什么?
很多人说在 AI 时代品味是人类最后的护城河,但 Boris Cherny 不这么认为——他看到的趋势是所谓「品味」也在被模型快速学会。
Claude CodeAnthropic 读全文 → -
06 约 8 分钟
拆解一份 500+ 条目的 LLM 资源清单:怎么从「大而全」里看出技术地图
一份跨近 30 个分类、条目早已过千的 LLM 资源清单,真正的价值不在「资源全」,而在用条目密度反推出每个技术方向现在有多拥挤。
资源清单技术地图 读全文 → -
07 约 6 分钟
把机器人数据采集精度干到 3 毫米:HiFi-UMI 昂贵的遥操作数据变得可有可无?
HiFi-UMI 用采集装置改造、传感器融合、仿真真机数据打通的组合方案把抓取精度做到 3 毫米级别,但这提升的是数据利用效率,不等于遥操作采集这个环节变得不重要。
机器人操作Sim2Real 读全文 → -
08 约 6 分钟
「任何人都能用 AI 编程」:被忽略的成本平移
AI 降低的是写代码的门槛,没有降低判断代码对不对的门槛。成本没有消失,只是从「写」平移到了「审」和「返工」,验证力弱的人风险会被推迟兑现。
AI编程成本结构 读全文 → -
09 约 5 分钟
我们可能误读了 Anthropic 的「销毁书籍」:它争的从来不是版权,是知识的解释权
法官把「用书训练」和「书从哪来」拆成两件事判——训练本身是合理使用,但留存盗版副本不受保护。真正的赌注是谁有权决定内容进入训练管线的正当路径。
版权Bartz v. Anthropic 读全文 → -
10 约 5 分钟
Scaling Law 不是物理定律,是「外推幻觉」
Scaling Law 是对已观测数据的经验拟合,不是物理定律。拟合得好不等于可以无限外推,把经验规律包装成「定律」的确定性语气,背后还有资本叙事的需要。
Scaling Law外推 读全文 → -
11 约 5 分钟
一个框架同时吃掉 3D 操作的三个老大难——BridgeVLA++ 的务实解法
冻住基座模型,只加一个约 9.2% 开销的记忆模块,把记忆依赖型任务成功率从 18.9% 拉到 96.0%。不靠堆大模型,靠精准打补丁解决 3D 操作的老大难。
机器人操作VLA 读全文 → -
12 约 6 分钟
当所有人都在聊 Harness 能"自我改进"时,我想泼一盆冷水
AHE 让 Agent 自动修 Harness,10 轮迭代跑赢人工设计版本。但论文自己的数据显示回归预测几乎是瞎猜,这个"回归盲区"才是判断它算不算真正自我改进的关键。
Agent Harness自我改进 读全文 → -
13 约 5 分钟
OpenAI 第一次把家底摊开:全球都在用 ChatGPT,但用在了不同的事上
Asking、Doing、Expressing 三分法显示,近半数 ChatGPT 使用价值在"想清楚"而非"做完"。约七成使用与工作无关,低收入国家采用增速是高收入国家 4 倍以上。
OpenAIChatGPT 读全文 → -
14 约 6 分钟
Google 用 ER 2 做了一件「不酷」的事,但可能做对了
安全指令遵循准确率从 47.2% 跳到 97.9%,提升幅度远超任何能力型指标。在行业普遍追求"能做什么"的氛围下,把最大投入放在拍不出演示视频的安全性上,可能是对的。
Gemini Robotics安全性 读全文 →