实用 AI 指南 › AI 术语表
AI Glossary · 2026
AI 术语表:30 个必懂概念的大白话解释
看 AI 相关内容最大的门槛不是难,是术语密度。这份术语表只做一件事:把 2026 年你最可能遇到的 AI 概念 讲成人话,并说明它为什么会影响你的实际使用——因为知道「上下文窗口」是什么,才能理解 为什么长对话会失忆。
一、最基础的六个词
大模型 LLM / Large Language Model
在海量文本上训练出来的语言模型,靠预测下一个 Token 来生成回答。它不是在数据库里查答案,而是根据学到的统计规律生成最可能的续写。这一点解释了它的两面:为什么它什么都能聊,也为什么它会一本正经地说错。
Token 词元
模型处理文本的最小单位,介于「字」和「词」之间。英文里一个 Token 约 0.75 个单词,中文大约 1 个汉字对应 1 到 2 个 Token。计费、长度上限、响应速度全都按 Token 算,所以「压缩提示词」是有实际成本收益的。
上下文窗口 Context Window
模型一次能同时「看到」的 Token 上限,输入和输出共享这个额度。超出的部分会被截断或挤出去——这就是长对话越聊越离题、上传大文件被拦的直接原因。2026 年主流模型在 20 万到 100 万 Token 区间,但能塞进去不等于能用好:内容越长,中间部分被忽略的概率越高。
← 图片可左右拖动查看 →
幻觉 Hallucination
模型生成了流畅、自信、但事实错误的内容。根因在于它优化的目标是「像不像真的」,而不是「是不是真的」。无法彻底消除,只能控制:让模型带引用来源、给它可检索的资料(RAG)、以及对关键结论人工核验。
多模态 Multimodal
模型能同时处理多种输入形式:文字、图片、音频、视频。实际意义是你可以直接截图问「这张报错怎么修」、拍照问「这份合同哪里有坑」,不必先把内容转成文字。
推理模型 Reasoning Model
在回答前先生成一段内部思考过程再给结论的模型(如 o 系列、DeepSeek-R1、Claude 的扩展思考)。在数学、代码、多步逻辑上明显更准,代价是更慢、更贵。日常问答不需要,复杂问题值得。
二、使用层面:提示词与上下文
提示词 Prompt
你给模型的输入。有效结构是角色 + 背景 + 任务 + 格式。比「写得好一点」有效得多的做法是:贴一段你认为好的示例——模型模仿模式的能力远强于理解形容词。
系统提示词 System Prompt
优先级高于对话内容的一层指令,用来设定模型的身份、边界和输出规范。你在 ChatGPT 里设置的「自定义指令」、在 Claude Project 里写的说明,都属于这一层。
少样本提示 Few-shot Prompting
在提示词里给 2 到 5 个「输入→输出」示例,让模型照着格式做。处理批量、格式固定的任务时,这是性价比最高的技巧,通常比微调先值得一试。
思维链 Chain-of-Thought, CoT
让模型「一步一步想」再给答案。对多步推理任务准确率提升明显。推理模型已经把这个过程内置了,所以对它们再喊「一步步想」意义不大。
温度 Temperature
控制输出随机性的参数。低(0 到 0.3)更稳定、适合提取信息和写代码;高(0.8 以上)更多样、适合头脑风暴。要可复现的结果就调低。
提示词注入 Prompt Injection
攻击者把恶意指令藏在模型会读到的内容里(网页、邮件、PDF),劫持它的行为。这是 Agent 时代最现实的安全问题:只要模型能读外部内容又能动手做事,就存在这个风险。原则是不要给 Agent 超出任务所需的权限。
三、构建层面:RAG、Agent、MCP
RAG(检索增强生成) Retrieval-Augmented Generation
先从你的文档库检索相关片段,再让模型基于这些片段回答。让模型用上私有资料和最新信息的标准做法,同时因为答案有出处,幻觉率明显下降。缺点是效果高度依赖检索质量——检索不到,模型照样瞎编。
Embedding(向量嵌入) Embedding
把文本转成一串数字(向量),语义相近的文本向量距离也近。这是「按意思搜索」而非「按关键词搜索」的基础,也是 RAG 的第一步。
向量数据库 Vector Database
专门存储和检索向量的数据库(Pinecone、Milvus、Qdrant、pgvector 等)。作用是在几百万条内容里快速找出语义最相近的几条。数据量不大时,普通数据库加向量插件通常就够。
重排 Reranking
向量检索先粗筛出几十条候选,再用更精确的模型给它们重新排序,只把最相关的几条交给大模型。RAG 效果不好时,加重排往往比换更强的大模型更有效。
Agent(智能体) AI Agent
能自主拆解任务、调用工具、根据结果决定下一步的 AI 程序。与单轮问答的本质区别是它有循环:行动 → 观察结果 → 修正 → 再行动。AI 编程助手能自己跑测试、看报错、改代码,就是这个机制。
工具调用 Function Calling / Tool Use
模型输出一个结构化请求,由外部程序执行(查数据库、发邮件、调 API),再把结果返回给模型。这是 Agent 能真正「做事」而不只是「说话」的关键接口。
MCP Model Context Protocol
Anthropic 提出的开放协议,用一套统一标准把外部数据源和工具接入 AI 应用。价值在于避免 N 个工具 × M 个客户端的重复集成——写一个 MCP Server,所有支持 MCP 的客户端都能用。
评测 Evals
用一组固定测试用例衡量 AI 系统的输出质量。这是 AI 项目从「感觉还行」走向能上线的分界线:没有评测,你改了提示词也不知道是变好还是变差。
四、模型层面:训练、微调与压缩
预训练 Pre-training
在海量通用文本上训练基础模型的阶段,成本极高(千万到数亿美元级),产出的是「什么都懂一点但不听指挥」的基础模型。
后训练与对齐 Post-training / Alignment
让基础模型变得听话、有用、安全的阶段,包含指令微调和基于人类反馈的强化学习(RLHF)。你日常用到的模型都是后训练过的版本。
微调 Fine-tuning
在通用模型上用自己的数据继续训练。适合改变行为(固定输出风格、格式、分类标准),不适合灌输知识——要让模型知道最新的公司资料,用 RAG 更便宜也更好维护。
LoRA Low-Rank Adaptation
只训练一小部分新增参数的轻量微调方法,显存和成本大幅下降,产出的适配器文件只有几十 MB,可以随时挂载或卸下。目前个人和小团队做微调的默认选择。
蒸馏 Distillation
用大模型的输出去训练小模型,让小模型在特定任务上接近大模型的表现,但更快更便宜。很多「小而强」的模型都是这么来的。
量化 Quantization
把模型权重从高精度压到低精度(如 16 位降到 4 位),体积和显存占用大幅下降,质量有轻微损失。本地跑模型的核心手段——4-bit 量化能让原本需要专业显卡的模型跑在消费级显卡上。
开源权重模型 Open-weight Model
公开模型权重、可自行下载部署的模型(Llama、Qwen、DeepSeek、Mistral 等)。注意「开源权重」不等于「开源」:训练数据和训练代码通常并不公开,许可协议也各有限制。
五、算力与部署
推理 Inference
模型训练完成后实际生成回答的过程。训练是一次性大额投入,推理是长期持续成本——所以一个产品能不能规模化,往往取决于单次推理成本。
本地部署 Local / On-device
在自己的电脑或服务器上运行模型(Ollama、LM Studio、vLLM)。优点是数据不出本机、无调用费用;代价是需要显存、速度和能力通常不及顶级云端模型。数据敏感时这是唯一选项。
算力租赁与「显卡期货」 GPU Rental / GPU Futures
按小时租用 GPU 的平台(Vast.ai、RunPod、Lambda Labs)让个人也能用上 H100 级算力,无需一次性买卡。「显卡期货」指提前预订、锁定未来一段时间算力的模式,逻辑类似商品期货,是应对高端 GPU 长期供不应求的一种手段。站内算力行情板块跟踪主流 GPU 的实时租赁价格。
发现错误或觉得某个词该补进来?欢迎邮件告诉我们: coolcahng@gmail.com。术语表会持续更新。