实用 AI 指南 › AI 能干嘛

Real Scenarios

AI 能干嘛?四个真实场景看清它的价值

别看技术参数了。这四件事我都在真实项目里做过,所以除了「它能干什么」,更要讲清它在哪一步会掉链子——知识检索的瓶颈在检索不在模型;专业文件它能翻译不能判断;数据分析最容易错的是口径而不是数值;写作省掉的是初稿,不是定稿。

最近更新:2026-07-30 · 作者:Useful AI Lab

Real Scenarios

AI 能帮你做什么?四个场景,连坑一起讲

这四件事我都在真实项目里做过。所以除了「它能干什么」,我更想告诉你「它在哪一步会掉链子」——那才是决定你用得下去还是放弃的地方。

🔍
工作效率

企业知识检索:决定成败的不是模型

公司文档散落在飞书、Notion、邮件、几年前的共享盘里。每次找一条制度或历史方案,都要翻半天,还经常翻到过期版本。

做法是把文档统一切块、建索引,你提问时系统先检索出最相关的几段,再让模型基于这几段作答并标出出处。这套东西叫 RAG。体感上确实是从翻十几分钟变成半分钟,而且答案能溯源。

真正的坑在检索,不在模型: 我见过的失败案例里,绝大多数问题出在检索环节——文档切块切断了上下文、没有标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样。换更强的模型对这些一点用都没有。更要紧的一点:文档本身是错的,AI 只会让你更快地拿到错答案。 上线前请务必先攒一份 50 道题的问答集,量一下检索命中率,别拿「看起来会回答」当验收标准。这一条几乎能决定项目生死。
图解 04 企业知识检索(RAG)的真实管线:坑在中间那一段 工程师向
RAG 企业知识检索管线:切块、索引、检索、重排、生成五个阶段与失败集中的环节 RAG 由文档切块、建立向量索引、检索候选、重排序、模型带出处作答五步组成。绝大多数失败集中在切块与检索重排阶段,换更强的模型无法修复检索缺陷。验收标准应是五十道问答集与检索命中率。 ↑ 90% 的失败集中在这一段 —— 换更强的模型救不了 01 文档切块 保留标题与日期 02 建向量索引 Embedding 03 检索候选 Top-K 片段 04 重排序 过期文档降权 05 带出处作答 可溯源 你的问题从这里进入 ⚠ 文档本身是错的 → AI 只会更快给你错答案 ✓ 验收标准:50 题问答集 + 检索命中率
这张图想说的只有一句话:RAG 的成败在检索,不在模型。切块切断了上下文、缺少标题和日期这类元数据、没做重排序、过期文档和现行文档权重一样——这四件事里任何一件出问题,换多强的模型都救不回来。上线前先攒 50 道题量检索命中率,别拿「看起来会回答」当验收标准。

← 图片可左右拖动查看 →

🏥
专业领域

看懂「天书」:它擅长翻译,不擅长判断

体检报告上的术语看不懂,合同条款读不下去,财报里的数字不知道哪个重要。

把文件丢给 AI,它能把「窦性心律,ST 段压低」翻成人话,能把合同里的关键义务和风险条款拎出来。这类任务它做得好是有原因的:术语翻译和结构化提取,本质上是文本到文本的映射,正好是模型最强的能力

边界要说清楚: 它读得懂写在纸上的东西,但专业判断常常来自没写在纸上的东西——你的病史、这份合同的谈判背景、这家公司的行业惯例。模型对缺失信息毫无感知,也不会提醒你「这里还缺一项检查」。所以正确用法是用它把自己从「完全看不懂」抬到「能问出好问题」,然后带着这些问题去见医生和律师。它省掉的是你的信息不对称,不是专业人士的判断。医疗、法律、财税上的决定,别让概率模型替你拍板。
📈
数据决策

不会 Excel 也能分析:但要盯住口径

老板要一份数据报告,你不会写公式、不会做图,面对一张几万行的表不知从哪下手。

把文件传给 AI,用大白话说「看看上个月哪个产品卖得最好、哪个地区在下滑,出几张图」。它会写代码去算、画图、给结论。注意这里的机制:它是写程序算出来的,不是「心算」出来的——所以数值运算本身通常是可靠的。

最容易翻车的不是算错,是口径错: 它不知道你公司的「活跃用户」是登录过还是下过单,不知道你的财月从哪天起算,不知道那批测试订单要剔除。口径一错,算得再准也是废的,而且看起来非常专业——这比明显报错危险得多。两个习惯能挡掉大部分问题:一是让它先复述一遍口径和过滤条件、你确认后再算;二是要求它把 SQL 或 Python 代码打出来。 代码是可审查的,结论不是。这也是我在工程上一直坚持的:宁可要一个能被检查的过程,不要一个漂亮的答案。
✍️
创意生产

写东西:初稿变便宜了,定稿没有

要写一篇文章、一个方案、一封难开口的邮件,盯着空白文档半小时憋不出一个字。

告诉 AI 写给谁、要达到什么目的、什么语气,十秒钟就有初稿。空白页恐惧确实被它解决了——从零到一变得极便宜。

但要小心它把你拉向平均值: 模型生成的是「最可能的下一句」,所以它天然输出行业里最常见的说法。你在它的初稿上改,很容易顺着一篇四平八稳的文章往下走,把自己原本那个不太成熟但真正有价值的想法丢掉。我的用法是反过来用它:先让它列出「这个观点最强的三条反驳」,或者「哪里逻辑跳跃了」。让它做压力测试,而不是做代笔——观点稀缺,文字不稀缺。
图解 05 判断 AI 能不能胜任某件事:只看一个问题 所有人 · 最实用的一张
以「对错能否低成本验证」为分界的 AI 任务判断图 对错可以低成本验证的任务,例如写代码有编译器与测试、数学有答案、翻译有对照、检索有出处,AI 进步极快且可以放手交付,人只需检查结果。无法低成本验证的任务,例如战略判断、审美取舍、需要担责的决定,AI 只能提供草稿。根本原因是强化学习需要可计算的奖励信号,没有验证器就没有快速迭代。 这件事的对错,能不能低成本验证? 不能 放手交给它,你只检查结果 · 写代码 —— 有编译器、有测试· 解数学题 —— 有标准答案· 翻译 —— 有原文可对照· 查资料 —— 有出处可核对 只能拿它的草稿和思路 · 战略判断 —— 对错要等很久才知道· 审美取舍 —— 没有唯一正确答案· 需要有人担责的决定· 人际分寸与组织内的取舍 为什么?强化学习需要「可计算的奖励」。没有验证器,就没有快速迭代——这条判据不会过期。
这是全站最值得记住的一张图。你不需要追工具榜单,只要问一句:这件事的对错,能不能低成本地验证?能验证的任务(代码、数学、翻译、检索)AI 进步极快,可以放手交付;不能验证的任务(战略、审美、要担责的决定)它只能给草稿,最终判断仍然是你的。原因在机制里:强化学习必须有可计算的奖励信号,没有验证器就没有迭代。

← 图片可左右拖动查看 →

📋 关于「AI 提效」的三句实话

  • 效率提升是真的,但极不均匀——省时间的地方集中在样板代码、陌生 API、格式转换、一次性脚本、初稿;越是需要你搞懂系统全貌和权衡取舍的任务,它帮的越少。别用平均倍数看这件事
  • 厂商倍数别当真,对照实验更值得看——METR 2025 年 7 月的随机对照试验发现:资深开源开发者在自己熟悉的仓库里用 AI 后,实测完成任务的时间反而多了约 19%,而他们本人以为自己快了 20%。这个「自我感觉」与「实测」的偏差,是这件事上最需要警惕的东西。该研究基于 2025 年初的工具,METR 已在 2026 年调整了实验设计,结论不宜过度外推——但它足以说明:提效要靠自己拿真实任务测,不能靠体感(内容依授权要求已改写)
  • 所以只有一个可靠办法——挑一件你每周都做的任务,用真实数据完整跑两遍。第二遍还赢不过你的老办法,那个工具就是「好看」而不是「有用」