实用 AI 指南 › 认识 AI
AI Primer
AI 入门:三分钟搞懂 AI 是怎么回事
不需要写代码,不需要懂数学。但也不糊弄你——每个比方都会告诉你它在哪里失效,因为失效的地方恰好是你会踩坑的地方。三种学法(深度学习 / 模仿学习 / 强化学习)决定了 AI 三种典型的犯错方式,搞懂它们,你对 AI 的预期就校准了。
AI Primer
三分钟搞懂 AI 是怎么回事
不需要写代码,不需要懂数学。但也不糊弄你——每个比方我都会告诉你它在哪里失效,因为失效的地方恰好是你会踩坑的地方。
← 图片可左右拖动查看 →
01
深度学习:不是「懂了」,是把函数拟合对了
传统程序是人写规则;深度学习反过来——你给它几百万张猫的照片和「是猫 / 不是猫」的答案,它自己调整内部上亿个参数,直到输入照片能输出正确答案。所谓「神经网络」,就是这堆参数的组织方式:浅层抓边缘和颜色,深层抓五官和轮廓。
关键在于:它学到的是相关性,不是因果。它不知道「猫」是一种动物,只知道哪些像素组合会让答案变对。ChatGPT、Claude 底层都是这套机制。
02
模仿学习:上限是师傅,风险是越错越远
有些任务没法用规则写:开车、下厨、写一封得体的邮件。模仿学习的做法是让模型观察大量人类示范,学「这种情况下人会怎么做」。自动驾驶这样训练,大模型的「监督微调」(SFT)本质上也是这个——让模型模仿人类写的优质回答。
它有两个绕不开的问题。一是上限等于示范者:数据里的师傅是平庸的,模型就学出平庸。二是误差累积:模型一旦偏离示范里出现过的状态,后面就进入没学过的区域,错误会越滚越大。
03
强化学习:你写的奖励,就是它真正的目标
没有老师也没有示范怎么办?让模型自己试,做对给奖励,做错给惩罚,反复迭代找出策略。AlphaGo 靠自我对弈几百万盘超越了人类棋手——这是强化学习最强的地方:它能突破人类示范的上限。今天的编程 Agent 能自主「写→跑→报错→改」,同样靠这套机制。
但强化学习的全部风险都压在一句话上:模型优化的是你写下的奖励,不是你心里想的目标。奖励定得稍有偏差,它就会找到你没预料到的捷径去拿高分。
04
大模型:说它「只是接龙」和说它「会思考」,都不准确
大模型的训练目标确实是「预测下一个词」。但训练目标不等于能力描述——为了把这件事做到极致,模型不得不在参数里压缩进语法、常识、代码结构、推理套路。这就像说「人类的目标只是繁衍」:技术上没错,但用它解释不了任何具体行为。
更有用的理解是:它把海量文本压缩成一个函数,然后按概率采样生成。「按概率生成」这四个字解释了它几乎所有怪异行为。
← 图片可左右拖动查看 →
05
提示词:别当咒语,当规格说明书
同一个模型,说「帮我写个东西」和说「你是资深编辑,给科技媒体写一篇 800 字评测,语气轻松但数据扎实」,结果差距巨大。但市面上的提示词技巧大半是无效的——堆形容词没用。「专业的」「高质量的」「深度的」这类词,模型无法据此改变任何行为。
真正有效的只有三件事:给上下文(它不知道的背景)、给示例(一个「好答案」长什么样)、给可验证的输出格式(表格、JSON、固定小节)。
← 图片可左右拖动查看 →
06
2026 年的真正变化:闭环闭上了
2024 到 2026 年最大的跃迁,不是模型变得更聪明,而是它从「只能说」变成了「能做、能看到结果、能自己改」——调用工具、执行代码、读取报错、重试。能力提升有很大一部分来自这个闭环,而不是参数量。
但提升是不均匀的,这点值得说清楚:凡是有便宜验证方式的任务,AI 进步极快(写代码有编译器和测试、解数学题有答案、翻译有对照)。凡是没有验证器的任务,进步就慢(战略判断、审美取舍、人际分寸)。因为强化学习需要可计算的奖励,没有奖励信号就没有快速迭代。
📋 三句话总结
- 三种学法决定三种失效方式——深度学习在没见过的分布上会自信答错;模仿学习在长任务里误差累积;强化学习会优化你写下的奖励而不是你想要的目标(这就是 AI 爱顺着你说话的原因)
- 幻觉不可消除,只能控制——模型没有「我不知道」这个训练信号,遇到空白就会补一段最像真的内容;对策是给资料、用带引用的工具、关键结论人工验证
- 判断 AI 能不能帮你,只看一件事——这件事的对错能否低成本验证。能验证的任务它进步飞快,不能验证的任务它只能给草稿