> 来源：Useful AI Lab（实用 AI / Useful AI）— https://usefulai.cloud/glossary/
> 作者：CarryChang · 最近更新：2026-07-30 · 语言：zh-CN

[实用 AI 指南](https://usefulai.cloud/) › AI 术语表

AI Glossary · 2026

# AI 术语表：30 个必懂概念的大白话解释

看 AI 相关内容最大的门槛不是难，是术语密度。这份术语表只做一件事：把 2026 年你最可能遇到的 AI 概念
讲成人话，并说明**它为什么会影响你的实际使用**——因为知道「上下文窗口」是什么，才能理解
为什么长对话会失忆。

最近更新：2026 年 7 月 30 日 · 作者：[Useful AI Lab](https://usefulai.cloud/about/)

## 目录

- 一、最基础的六个词

- 二、使用层面：提示词与上下文

- 三、构建层面：RAG、Agent、MCP

- 四、模型层面：训练、微调与压缩

- 五、算力与部署

## 一、最基础的六个词

### 大模型 LLM / Large Language Model

在海量文本上训练出来的语言模型，靠**预测下一个 Token** 来生成回答。它不是在数据库里查答案，而是根据学到的统计规律生成最可能的续写。这一点解释了它的两面：为什么它什么都能聊，也为什么它会一本正经地说错。

### Token 词元

模型处理文本的最小单位，介于「字」和「词」之间。英文里一个 Token 约 0.75 个单词，中文大约 1 个汉字对应 1 到 2 个 Token。**计费、长度上限、响应速度全都按 Token 算**，所以「压缩提示词」是有实际成本收益的。

### 上下文窗口 Context Window

模型一次能同时「看到」的 Token 上限，输入和输出共享这个额度。超出的部分会被截断或挤出去——这就是长对话越聊越离题、上传大文件被拦的直接原因。2026 年主流模型在 20 万到 100 万 Token 区间，但**能塞进去不等于能用好**：内容越长，中间部分被忽略的概率越高。

**图解 12**：
上下文窗口：长对话为什么会「失忆」，中间为什么容易被忽略
（适合：所有人）

**「能塞进去」不等于「能用好」。**上下文窗口是输入和输出共享的一个额度，装满之后最早的内容会被挤出去——这就是长对话失忆的直接原因。更实用的一点是**注意力分布不均匀**：开头和结尾被关注得最多，中间最容易被忽略。所以把最关键的要求写在最后一句，长文档先摘要再提问。

### 幻觉 Hallucination

模型生成了流畅、自信、但事实错误的内容。根因在于它优化的目标是「像不像真的」，而不是「是不是真的」。**无法彻底消除，只能控制**：让模型带引用来源、给它可检索的资料（RAG）、以及对关键结论人工核验。

### 多模态 Multimodal

模型能同时处理多种输入形式：文字、图片、音频、视频。实际意义是你可以直接截图问「这张报错怎么修」、拍照问「这份合同哪里有坑」，不必先把内容转成文字。

### 推理模型 Reasoning Model

在回答前先生成一段内部思考过程再给结论的模型（如 o 系列、DeepSeek-R1、Claude 的扩展思考）。在数学、代码、多步逻辑上明显更准，代价是**更慢、更贵**。日常问答不需要，复杂问题值得。

## 二、使用层面：提示词与上下文

### 提示词 Prompt

你给模型的输入。有效结构是**角色 + 背景 + 任务 + 格式**。比「写得好一点」有效得多的做法是：贴一段你认为好的示例——模型模仿模式的能力远强于理解形容词。

### 系统提示词 System Prompt

优先级高于对话内容的一层指令，用来设定模型的身份、边界和输出规范。你在 ChatGPT 里设置的「自定义指令」、在 Claude Project 里写的说明，都属于这一层。

### 少样本提示 Few-shot Prompting

在提示词里给 2 到 5 个「输入→输出」示例，让模型照着格式做。处理批量、格式固定的任务时，这是性价比最高的技巧，通常比微调先值得一试。

### 思维链 Chain-of-Thought, CoT

让模型「一步一步想」再给答案。对多步推理任务准确率提升明显。推理模型已经把这个过程内置了，所以对它们再喊「一步步想」意义不大。

### 温度 Temperature

控制输出随机性的参数。低（0 到 0.3）更稳定、适合提取信息和写代码；高（0.8 以上）更多样、适合头脑风暴。要可复现的结果就调低。

### 提示词注入 Prompt Injection

攻击者把恶意指令藏在模型会读到的内容里（网页、邮件、PDF），劫持它的行为。**这是 Agent 时代最现实的安全问题**：只要模型能读外部内容又能动手做事，就存在这个风险。原则是不要给 Agent 超出任务所需的权限。

## 三、构建层面：RAG、Agent、MCP

### RAG（检索增强生成） Retrieval-Augmented Generation

先从你的文档库检索相关片段，再让模型基于这些片段回答。**让模型用上私有资料和最新信息的标准做法**，同时因为答案有出处，幻觉率明显下降。缺点是效果高度依赖检索质量——检索不到，模型照样瞎编。

### Embedding（向量嵌入） Embedding

把文本转成一串数字（向量），语义相近的文本向量距离也近。这是「按意思搜索」而非「按关键词搜索」的基础，也是 RAG 的第一步。

### 向量数据库 Vector Database

专门存储和检索向量的数据库（Pinecone、Milvus、Qdrant、pgvector 等）。作用是在几百万条内容里快速找出语义最相近的几条。数据量不大时，普通数据库加向量插件通常就够。

### 重排 Reranking

向量检索先粗筛出几十条候选，再用更精确的模型给它们重新排序，只把最相关的几条交给大模型。RAG 效果不好时，加重排往往比换更强的大模型更有效。

### Agent（智能体） AI Agent

能自主拆解任务、调用工具、根据结果决定下一步的 AI 程序。与单轮问答的本质区别是它有**循环**：行动 → 观察结果 → 修正 → 再行动。AI 编程助手能自己跑测试、看报错、改代码，就是这个机制。

### 工具调用 Function Calling / Tool Use

模型输出一个结构化请求，由外部程序执行（查数据库、发邮件、调 API），再把结果返回给模型。这是 Agent 能真正「做事」而不只是「说话」的关键接口。

### MCP Model Context Protocol

Anthropic 提出的开放协议，用一套统一标准把外部数据源和工具接入 AI 应用。价值在于避免 N 个工具 × M 个客户端的重复集成——写一个 MCP Server，所有支持 MCP 的客户端都能用。

### 评测 Evals

用一组固定测试用例衡量 AI 系统的输出质量。**这是 AI 项目从「感觉还行」走向能上线的分界线**：没有评测，你改了提示词也不知道是变好还是变差。

## 四、模型层面：训练、微调与压缩

### 预训练 Pre-training

在海量通用文本上训练基础模型的阶段，成本极高（千万到数亿美元级），产出的是「什么都懂一点但不听指挥」的基础模型。

### 后训练与对齐 Post-training / Alignment

让基础模型变得听话、有用、安全的阶段，包含指令微调和基于人类反馈的强化学习（RLHF）。你日常用到的模型都是后训练过的版本。

### 微调 Fine-tuning

在通用模型上用自己的数据继续训练。**适合改变行为**（固定输出风格、格式、分类标准），**不适合灌输知识**——要让模型知道最新的公司资料，用 RAG 更便宜也更好维护。

### LoRA Low-Rank Adaptation

只训练一小部分新增参数的轻量微调方法，显存和成本大幅下降，产出的适配器文件只有几十 MB，可以随时挂载或卸下。目前个人和小团队做微调的默认选择。

### 蒸馏 Distillation

用大模型的输出去训练小模型，让小模型在特定任务上接近大模型的表现，但更快更便宜。很多「小而强」的模型都是这么来的。

### 量化 Quantization

把模型权重从高精度压到低精度（如 16 位降到 4 位），体积和显存占用大幅下降，质量有轻微损失。本地跑模型的核心手段——4-bit 量化能让原本需要专业显卡的模型跑在消费级显卡上。

### 开源权重模型 Open-weight Model

公开模型权重、可自行下载部署的模型（Llama、Qwen、DeepSeek、Mistral 等）。注意「开源权重」不等于「开源」：训练数据和训练代码通常并不公开，许可协议也各有限制。

## 五、算力与部署

### 推理 Inference

模型训练完成后实际生成回答的过程。训练是一次性大额投入，**推理是长期持续成本**——所以一个产品能不能规模化，往往取决于单次推理成本。

### 本地部署 Local / On-device

在自己的电脑或服务器上运行模型（Ollama、LM Studio、vLLM）。优点是数据不出本机、无调用费用；代价是需要显存、速度和能力通常不及顶级云端模型。数据敏感时这是唯一选项。

### 算力租赁与「显卡期货」 GPU Rental / GPU Futures

按小时租用 GPU 的平台（Vast.ai、RunPod、Lambda Labs）让个人也能用上 H100 级算力，无需一次性买卡。「显卡期货」指提前预订、锁定未来一段时间算力的模式，逻辑类似商品期货，是应对高端 GPU 长期供不应求的一种手段。站内[算力行情板块](https://usefulai.cloud/#invest)跟踪主流 GPU 的实时租赁价格。

发现错误或觉得某个词该补进来？欢迎邮件告诉我们：
[coolcahng@gmail.com](mailto:coolcahng@gmail.com)。术语表会持续更新。

[三分钟搞懂 AI 是怎么回事 → 深度学习、模仿学习、强化学习，以及大模型到底在做什么。](https://usefulai.cloud/#primer)
[AI 工具推荐 → ChatGPT、Claude、Perplexity、Cursor、DeepSeek、Kimi 怎么选。](https://usefulai.cloud/#tools)
[Useful AI (English) → What makes AI useful, and what just demos well.](https://usefulai.cloud/en/)
