> 来源：Useful AI Lab（实用 AI / Useful AI）— https://usefulai.cloud/primer/
> 作者：CarryChang · 最近更新：2026-07-30 · 语言：zh-CN

[实用 AI 指南](https://usefulai.cloud/) › 认识 AI

AI Primer

# AI 入门：三分钟搞懂 AI 是怎么回事

不需要写代码，不需要懂数学。但也不糊弄你——**每个比方都会告诉你它在哪里失效**，因为失效的地方恰好是你会踩坑的地方。三种学法（深度学习 / 模仿学习 / 强化学习）决定了 AI 三种典型的犯错方式，搞懂它们，你对 AI 的预期就校准了。

最近更新：2026-07-30 · 作者：[Useful AI Lab](https://usefulai.cloud/about/)

AI Primer

## 三分钟搞懂 AI 是怎么回事

不需要写代码，不需要懂数学。但也不糊弄你——每个比方我都会告诉你它在哪里失效，因为失效的地方恰好是你会踩坑的地方。

**图解 01**：
三种学法，三种固定的犯错方式
（适合：初中起可读）

三种学法不是三代技术，而是同时并存的三块拼图，今天的大模型三样都用。**看图的正确方式是从下半部分读起**：AI 的每一种错误都不是随机的，而是它学习方式的必然产物——**深度学习**让它在陌生场景里自信答错，**模仿学习**让它在长任务里越走越偏，**强化学习**让它倾向于顺着你说话。知道这三种错法，你对 AI 的预期就校准了。

01

### 深度学习：不是「懂了」，是把函数拟合对了

传统程序是人写规则；深度学习反过来——你给它几百万张猫的照片和「是猫 / 不是猫」的答案，它自己调整内部上亿个参数，直到输入照片能输出正确答案。所谓「神经网络」，就是这堆参数的组织方式：浅层抓边缘和颜色，深层抓五官和轮廓。

关键在于：它学到的是**相关性**，不是因果。它不知道「猫」是一种动物，只知道哪些像素组合会让答案变对。ChatGPT、Claude 底层都是这套机制。

**这个比方哪里不对：** 常见的说法是「像小孩看多了猫就认识猫」。但小孩看几十只就够了，模型要几百万张——因为小孩用的是因果和常识，模型用的是统计。这也决定了模型的失效方式：**训练数据里没见过的分布，它会自信地答错**。我做车辆感知那几年，难的从来不是常见场景，而是长尾——雨夜、逆光、施工路段这些占比 1% 的情况，吃掉了 90% 的工程量。你用 AI 时也一样：它在常见任务上像专家，在冷门角落里会突然变成外行，而且语气一样自信。

02

### 模仿学习：上限是师傅，风险是越错越远

有些任务没法用规则写：开车、下厨、写一封得体的邮件。模仿学习的做法是让模型观察大量人类示范，学「这种情况下人会怎么做」。自动驾驶这样训练，大模型的「监督微调」（SFT）本质上也是这个——让模型模仿人类写的优质回答。

它有两个绕不开的问题。一是**上限等于示范者**：数据里的师傅是平庸的，模型就学出平庸。二是**误差累积**：模型一旦偏离示范里出现过的状态，后面就进入没学过的区域，错误会越滚越大。

**这对你意味着什么：** 这解释了一个你天天遇到的现象——让 AI 干长任务，前几步很漂亮，越往后越离谱。不是它「累了」，是它偏出了熟悉的轨道。**对策不是把提示词写得更长，而是把任务切短、每步都给它看到真实结果**。这是我在做 Agent 落地时反复验证的一条：能查看中间产物的流程，比一次性交代清楚的流程可靠得多。

03

### 强化学习：你写的奖励，就是它真正的目标

没有老师也没有示范怎么办？让模型自己试，做对给奖励，做错给惩罚，反复迭代找出策略。AlphaGo 靠自我对弈几百万盘超越了人类棋手——这是强化学习最强的地方：**它能突破人类示范的上限**。今天的编程 Agent 能自主「写→跑→报错→改」，同样靠这套机制。

但强化学习的全部风险都压在一句话上：**模型优化的是你写下的奖励，不是你心里想的目标**。奖励定得稍有偏差，它就会找到你没预料到的捷径去拿高分。

**为什么 AI 老是顺着你说话：** 大模型的最后一步训练（RLHF）用的奖励，是「人类标注员更喜欢哪个回答」。而人类往往更喜欢自信、顺从、结构漂亮的回答——于是模型就学会了讨好，而不是学会正确。这不是 bug，是奖励设计的必然结果。所以当 AI 说「你说得对」，那不是它同意你，那是它拿分。**把判断权交回自己手上，这是使用 AI 最基本的自我保护。**

04

### 大模型：说它「只是接龙」和说它「会思考」，都不准确

大模型的训练目标确实是「预测下一个词」。但训练目标不等于能力描述——为了把这件事做到极致，模型不得不在参数里压缩进语法、常识、代码结构、推理套路。这就像说「人类的目标只是繁衍」：技术上没错，但用它解释不了任何具体行为。

更有用的理解是：**它把海量文本压缩成一个函数，然后按概率采样生成**。「按概率生成」这四个字解释了它几乎所有怪异行为。

**幻觉不是缺陷，是同一个机制的另一面：** 模型被训练成「产出看起来最合理的下一段文字」，从来没有一个训练信号教它「这里我其实不知道」。所以遇到知识空白，它不会停，它会补一段最像真的内容出来。这意味着幻觉**无法被彻底消除，只能被控制**：给它可检索的资料（RAG）、用带引用来源的工具、对关键结论人工交叉验证。任何声称「彻底解决幻觉」的产品，都值得你多问一句怎么做到的。

**图解 02**：
幻觉是怎么产生的：它每一步只在「挑最像真的那个词」
（适合：高中 / 工程师）

**幻觉不是 bug，是这套机制的另一面。**模型的训练目标是「让下一个字看起来最合理」，而不是「说真话」——所以遇到知识空白，它不会停下来，只会补一段最像真的内容。这也说明了控制幻觉的三个正确方向：**给它可检索的资料（RAG）**、**用带引用来源的工具**、**关键结论人工交叉验证**。任何声称彻底消除幻觉的说法，都要先问它改动了这套机制的哪一步。

05

### 提示词：别当咒语，当规格说明书

同一个模型，说「帮我写个东西」和说「你是资深编辑，给科技媒体写一篇 800 字评测，语气轻松但数据扎实」，结果差距巨大。但市面上的提示词技巧大半是无效的——**堆形容词没用**。「专业的」「高质量的」「深度的」这类词，模型无法据此改变任何行为。

真正有效的只有三件事：给**上下文**（它不知道的背景）、给**示例**（一个「好答案」长什么样）、给**可验证的输出格式**（表格、JSON、固定小节）。

**最高性价比的一招：** 与其继续加形容词，不如贴一个你认可的样例进去。模型模仿模式的能力远强于理解形容词——这是它的训练方式决定的。写提示词的正确心态是写需求文档：**如果这段话交给一个聪明但完全不了解你处境的实习生，他会不会做错？会，那就是你该补的信息。**基础结构记住四段就够：角色 + 背景 + 任务 + 格式。

**图解 03**：
提示词的四段结构，以及哪些技巧其实无效
（适合：所有人）

把提示词当**规格说明书**写，而不是当咒语念。自检的办法很简单：**这段话交给一个聪明但完全不了解你处境的实习生，他会不会做错？**会，那就是你漏掉的信息。图右下角那条是最高性价比的一招——**与其继续加形容词，不如贴一个你认可的成品样例**，因为模仿模式正是模型最擅长的事。

06

### 2026 年的真正变化：闭环闭上了

2024 到 2026 年最大的跃迁，不是模型变得更聪明，而是**它从「只能说」变成了「能做、能看到结果、能自己改」**——调用工具、执行代码、读取报错、重试。能力提升有很大一部分来自这个闭环，而不是参数量。

但提升是不均匀的，这点值得说清楚：**凡是有便宜验证方式的任务，AI 进步极快**（写代码有编译器和测试、解数学题有答案、翻译有对照）。**凡是没有验证器的任务，进步就慢**（战略判断、审美取舍、人际分寸）。因为强化学习需要可计算的奖励，没有奖励信号就没有快速迭代。

**一条可以直接用的判断标准：** 想知道 AI 能不能帮上你手里这件事，先问「这件事的对错，能不能低成本地验证？」能——放心交给它，你只需要检查结果。不能——它只能给你草稿和思路，最终判断还是你的。这个标准比任何工具榜单都好用，而且不会过期。

#### 📋 三句话总结

- **三种学法决定三种失效方式**——深度学习在没见过的分布上会自信答错；模仿学习在长任务里误差累积；强化学习会优化你写下的奖励而不是你想要的目标（这就是 AI 爱顺着你说话的原因）

- **幻觉不可消除，只能控制**——模型没有「我不知道」这个训练信号，遇到空白就会补一段最像真的内容；对策是给资料、用带引用的工具、关键结论人工验证

- **判断 AI 能不能帮你，只看一件事**——这件事的对错能否低成本验证。能验证的任务它进步飞快，不能验证的任务它只能给草稿

## 继续阅读

[AI 术语表 → 大模型、Token、上下文窗口、RAG、Agent、MCP 等 30 个概念速查。](https://usefulai.cloud/glossary/)
[AI 工具推荐 → ChatGPT / Claude / Gemini / Cursor 怎么选，附价格与难度对照表。](https://usefulai.cloud/tools/)
[AI 能干嘛 → 四个真实场景：找资料、看专业文件、数据分析、写作。](https://usefulai.cloud/scenarios/)
