实用 AI 指南 › AI 术语表

AI Glossary · 2026

AI 术语表:30 个必懂概念的大白话解释

看 AI 相关内容最大的门槛不是难,是术语密度。这份术语表只做一件事:把 2026 年你最可能遇到的 AI 概念 讲成人话,并说明它为什么会影响你的实际使用——因为知道「上下文窗口」是什么,才能理解 为什么长对话会失忆。

最近更新:2026 年 7 月 30 日 · 作者:Useful AI Lab

一、最基础的六个词

大模型 LLM / Large Language Model

在海量文本上训练出来的语言模型,靠预测下一个 Token 来生成回答。它不是在数据库里查答案,而是根据学到的统计规律生成最可能的续写。这一点解释了它的两面:为什么它什么都能聊,也为什么它会一本正经地说错。

Token 词元

模型处理文本的最小单位,介于「字」和「词」之间。英文里一个 Token 约 0.75 个单词,中文大约 1 个汉字对应 1 到 2 个 Token。计费、长度上限、响应速度全都按 Token 算,所以「压缩提示词」是有实际成本收益的。

上下文窗口 Context Window

模型一次能同时「看到」的 Token 上限,输入和输出共享这个额度。超出的部分会被截断或挤出去——这就是长对话越聊越离题、上传大文件被拦的直接原因。2026 年主流模型在 20 万到 100 万 Token 区间,但能塞进去不等于能用好:内容越长,中间部分被忽略的概率越高。

图解 12 上下文窗口:长对话为什么会「失忆」,中间为什么容易被忽略 所有人
上下文窗口示意图:输入与输出共享同一额度,超出部分被挤出,中间内容最容易被忽略 上下文窗口是模型一次能同时看到的 Token 上限,系统提示、对话历史、你的问题和模型输出共享这一额度。额度用满时最早的内容被挤出,这是长对话失忆的原因。窗口开头与结尾的内容被关注最多,中间部分最容易被忽略。对策是把关键要求放在最后一句,长文档先摘要再提问。 一次请求里,这些内容挤在同一个额度里 系统提示 之前的所有对话历史 你这次的问题 它的回答 额度用满后,最早的内容会被挤出去 —— 这就是长对话「失忆」 而且注意力并不平均分配: 开头看得最清 中间最容易被忽略 结尾看得最清 对策:最关键的要求放在最后一句;长文档先摘要再提问,而不是整本塞进去。
「能塞进去」不等于「能用好」。上下文窗口是输入和输出共享的一个额度,装满之后最早的内容会被挤出去——这就是长对话失忆的直接原因。更实用的一点是注意力分布不均匀:开头和结尾被关注得最多,中间最容易被忽略。所以把最关键的要求写在最后一句,长文档先摘要再提问。

← 图片可左右拖动查看 →

幻觉 Hallucination

模型生成了流畅、自信、但事实错误的内容。根因在于它优化的目标是「像不像真的」,而不是「是不是真的」。无法彻底消除,只能控制:让模型带引用来源、给它可检索的资料(RAG)、以及对关键结论人工核验。

多模态 Multimodal

模型能同时处理多种输入形式:文字、图片、音频、视频。实际意义是你可以直接截图问「这张报错怎么修」、拍照问「这份合同哪里有坑」,不必先把内容转成文字。

推理模型 Reasoning Model

在回答前先生成一段内部思考过程再给结论的模型(如 o 系列、DeepSeek-R1、Claude 的扩展思考)。在数学、代码、多步逻辑上明显更准,代价是更慢、更贵。日常问答不需要,复杂问题值得。

二、使用层面:提示词与上下文

提示词 Prompt

你给模型的输入。有效结构是角色 + 背景 + 任务 + 格式。比「写得好一点」有效得多的做法是:贴一段你认为好的示例——模型模仿模式的能力远强于理解形容词。

系统提示词 System Prompt

优先级高于对话内容的一层指令,用来设定模型的身份、边界和输出规范。你在 ChatGPT 里设置的「自定义指令」、在 Claude Project 里写的说明,都属于这一层。

少样本提示 Few-shot Prompting

在提示词里给 2 到 5 个「输入→输出」示例,让模型照着格式做。处理批量、格式固定的任务时,这是性价比最高的技巧,通常比微调先值得一试。

思维链 Chain-of-Thought, CoT

让模型「一步一步想」再给答案。对多步推理任务准确率提升明显。推理模型已经把这个过程内置了,所以对它们再喊「一步步想」意义不大。

温度 Temperature

控制输出随机性的参数。低(0 到 0.3)更稳定、适合提取信息和写代码;高(0.8 以上)更多样、适合头脑风暴。要可复现的结果就调低。

提示词注入 Prompt Injection

攻击者把恶意指令藏在模型会读到的内容里(网页、邮件、PDF),劫持它的行为。这是 Agent 时代最现实的安全问题:只要模型能读外部内容又能动手做事,就存在这个风险。原则是不要给 Agent 超出任务所需的权限。

三、构建层面:RAG、Agent、MCP

RAG(检索增强生成) Retrieval-Augmented Generation

先从你的文档库检索相关片段,再让模型基于这些片段回答。让模型用上私有资料和最新信息的标准做法,同时因为答案有出处,幻觉率明显下降。缺点是效果高度依赖检索质量——检索不到,模型照样瞎编。

Embedding(向量嵌入) Embedding

把文本转成一串数字(向量),语义相近的文本向量距离也近。这是「按意思搜索」而非「按关键词搜索」的基础,也是 RAG 的第一步。

向量数据库 Vector Database

专门存储和检索向量的数据库(Pinecone、Milvus、Qdrant、pgvector 等)。作用是在几百万条内容里快速找出语义最相近的几条。数据量不大时,普通数据库加向量插件通常就够。

重排 Reranking

向量检索先粗筛出几十条候选,再用更精确的模型给它们重新排序,只把最相关的几条交给大模型。RAG 效果不好时,加重排往往比换更强的大模型更有效。

Agent(智能体) AI Agent

能自主拆解任务、调用工具、根据结果决定下一步的 AI 程序。与单轮问答的本质区别是它有循环:行动 → 观察结果 → 修正 → 再行动。AI 编程助手能自己跑测试、看报错、改代码,就是这个机制。

工具调用 Function Calling / Tool Use

模型输出一个结构化请求,由外部程序执行(查数据库、发邮件、调 API),再把结果返回给模型。这是 Agent 能真正「做事」而不只是「说话」的关键接口。

MCP Model Context Protocol

Anthropic 提出的开放协议,用一套统一标准把外部数据源和工具接入 AI 应用。价值在于避免 N 个工具 × M 个客户端的重复集成——写一个 MCP Server,所有支持 MCP 的客户端都能用。

评测 Evals

用一组固定测试用例衡量 AI 系统的输出质量。这是 AI 项目从「感觉还行」走向能上线的分界线:没有评测,你改了提示词也不知道是变好还是变差。

四、模型层面:训练、微调与压缩

预训练 Pre-training

在海量通用文本上训练基础模型的阶段,成本极高(千万到数亿美元级),产出的是「什么都懂一点但不听指挥」的基础模型。

后训练与对齐 Post-training / Alignment

让基础模型变得听话、有用、安全的阶段,包含指令微调和基于人类反馈的强化学习(RLHF)。你日常用到的模型都是后训练过的版本。

微调 Fine-tuning

在通用模型上用自己的数据继续训练。适合改变行为(固定输出风格、格式、分类标准),不适合灌输知识——要让模型知道最新的公司资料,用 RAG 更便宜也更好维护。

LoRA Low-Rank Adaptation

只训练一小部分新增参数的轻量微调方法,显存和成本大幅下降,产出的适配器文件只有几十 MB,可以随时挂载或卸下。目前个人和小团队做微调的默认选择。

蒸馏 Distillation

用大模型的输出去训练小模型,让小模型在特定任务上接近大模型的表现,但更快更便宜。很多「小而强」的模型都是这么来的。

量化 Quantization

把模型权重从高精度压到低精度(如 16 位降到 4 位),体积和显存占用大幅下降,质量有轻微损失。本地跑模型的核心手段——4-bit 量化能让原本需要专业显卡的模型跑在消费级显卡上。

开源权重模型 Open-weight Model

公开模型权重、可自行下载部署的模型(Llama、Qwen、DeepSeek、Mistral 等)。注意「开源权重」不等于「开源」:训练数据和训练代码通常并不公开,许可协议也各有限制。

五、算力与部署

推理 Inference

模型训练完成后实际生成回答的过程。训练是一次性大额投入,推理是长期持续成本——所以一个产品能不能规模化,往往取决于单次推理成本。

本地部署 Local / On-device

在自己的电脑或服务器上运行模型(Ollama、LM Studio、vLLM)。优点是数据不出本机、无调用费用;代价是需要显存、速度和能力通常不及顶级云端模型。数据敏感时这是唯一选项。

算力租赁与「显卡期货」 GPU Rental / GPU Futures

按小时租用 GPU 的平台(Vast.ai、RunPod、Lambda Labs)让个人也能用上 H100 级算力,无需一次性买卡。「显卡期货」指提前预订、锁定未来一段时间算力的模式,逻辑类似商品期货,是应对高端 GPU 长期供不应求的一种手段。站内算力行情板块跟踪主流 GPU 的实时租赁价格。

发现错误或觉得某个词该补进来?欢迎邮件告诉我们: coolcahng@gmail.com。术语表会持续更新。