大模型 / LLM
Large Language Model
靠海量文本训练出来、能理解和生成自然语言的 AI。你跟它聊天、让它写代码、润色文案,底层都是大模型在干活。
什么时候用:只要需求涉及"理解或生成文字",基本都建立在某个大模型之上。
词元 / Token
Token
模型计量的基本单位,约等于"半个到几个汉字 / 一个英文单词"。模型的计费、上下文长度都按 token 算,不是按"字"算。
什么时候用:估算 API 调用成本、判断一段话会不会超长时必看。
API 密钥 / API Key
API Key
调用大模型服务的"钥匙 / 账号密码"。有了它,你的程序才能花钱请模型干活。泄露出去会被别人白嫖额度。
什么时候用:任何把 AI 能力接进自己系统的场景,都要先申请并保管好 Key。
上下文窗口 (Context Window)
Context Window
模型一次能"看到"的最大文字量(token 上限)。超出的部分会被截断,模型就"忘"了。
什么时候用:写长文档、往提示里塞知识库内容时,要留意别超过窗口。
微调 / Fine-tuning
Fine-tuning
用你自己的数据再训练模型,让它更懂你的领域。成本高、门槛高,是"进阶中的进阶"。
什么时候用:通用模型不够用、且你有足量标注数据时。多数人先用提示词 + 知识库即可。
幻觉 (Hallucination)
Hallucination
模型一本正经地编假信息、张冠李戴。这是大模型的先天特性,不是 bug,目前无法根除。
什么时候用:所有严肃场景都要有"查证 / 兜底"机制(如 RAG、人工复核)。
推理 / Inference
Inference
模型"跑起来回答问题"的过程,区别于前期的训练。你每次提问,都是在触发一次推理。
什么时候用:聊"响应速度 / 并发成本"时,指的就是推理环节。
提示词 (Prompt)
Prompt
你给模型的指令 / 问题。写得好不好,直接决定输出质量——很多时候调提示词比换模型更划算。
什么时候用:任何和模型对话、让它干活的场景,第一步就是写好提示词。
系统提示词 (System Prompt)
System Prompt
设定模型"人设 / 规则 / 边界"的隐藏指令,通常用户看不到,但在整段对话里优先级最高。
什么时候用:做产品时,用系统提示词锁定模型的身份和行为规范。
Few-shot 少样本
Few-shot
在提示词里给几个"示例问答",让模型照着学。比空口说"按这个格式输出"稳得多。
什么时候用:需要固定输出格式、或任务较刁钻时,给例子最有效。
思维链 CoT (Chain of Thought)
Chain of Thought
让模型"先一步步想、再给答案",而非直接蹦结论。经典一句提示:"让我们一步步思考"。
什么时候用:数学、逻辑、多步推理类问题,加上 CoT 准确率明显提升。
结构化输出
Structured Output
要求模型返回 JSON / XML 等固定格式,方便程序自动解析,而不是一段自由文本。
什么时候用:要把 AI 结果接进数据库、表单、工作流时必备。
角色扮演 / Persona
Persona
让模型扮演某类专家(如"你是资深后端工程师"),输出会更贴领域、更专业。
什么时候用:希望输出带特定口吻或专业视角时,先给角色。
RAG 检索增强生成
Retrieval-Augmented Generation
先去知识库"查资料",再把资料连同问题一起喂给模型,让它"有据可依",大幅减少胡说。是落地知识问答的主流方案。
什么时候用:回答必须基于你自己的文档(产品手册、内部制度)时。
向量数据库 (Vector DB)
Vector Database
把文字转成向量后存放、按"语义相似度"检索的数据库。RAG 的底座(如 Milvus、Qdrant、pgvector)。
什么时候用:做 RAG 时,向量库负责"根据问题找最相关的段落"。
Embedding 嵌入
Embedding
把一段文字变成一串数字(向量)。语义相近的文字,向量也相近——这是"语义搜索"能工作的核心。
什么时候用:入库和检索时都要先把文字 Embedding 成向量。
分块 (Chunking)
Chunking
把长文档切成小段再入库,检索更精准。切太大(噪音多)或太小(语义碎)都不好,需要调。
什么时候用:准备知识库文档时,分块策略直接影响问答质量。
Rerank 重排序
Rerank
先"粗召回"一批候选,再用更精细的模型重新排序,把最相关的排到最前面。
什么时候用:想进一步提升 RAG 命中精度时的关键一环。
知识库
Knowledge Base
你整理好、可供检索的文档集合(产品手册、内部制度、FAQ 等)。RAG 的"外部大脑"。
什么时候用:想让 AI 回答"只有你们公司才知道"的问题时。
Agent 智能体
Agent
能"自己规划 + 调用工具 + 反复试错"去完成任务的 AI,不再只是一问一答。给它目标,它自己想办法。
什么时候用:任务有多步、需要和外部系统打交道时,用 Agent 而非纯对话。
工具调用 / Function Calling
Function Calling
模型自己决定"该调哪个函数 / 接口"(查天气、读文件、发邮件),把结果拿回来继续推理。
什么时候用:让 AI 不止能"说",还能"做"的时候。
ReAct(推理+行动)
Reason + Act
经典 Agent 范式:模型先"推理(Reason)"要干嘛,再"行动(Act)"调工具,看结果再推理,循环到任务完成。
什么时候用:理解 Agent 怎么"想一步做一步"的核心范式。
多 Agent 协作
Multi-Agent
多个各有所长的智能体分工配合(如一个写方案、一个做审核),像一个小团队。
什么时候用:复杂任务拆给不同角色,比单个 Agent 硬扛更稳。
记忆 (Memory)
Memory
让 Agent 记住历史对话 / 中间结果,避免每次都从零开始。分短期(本轮对话)和长期(跨会话)。
什么时候用:需要 Agent 续上之前的上下文、积累经验时。
工作流 / Workflow
Workflow
把多个步骤 / 工具按固定流程串起来自动跑(如 Dify 工作流)。比让 Agent 自由发挥更可控。
什么时候用:流程确定、要稳定可复现时,用工作流而非自由 Agent。
MCP (Model Context Protocol)
Model Context Protocol
给 AI 接工具的"统一插头"标准。一次接好,各家模型都能用,不用为每个模型重写一遍。已成为事实标准(由 Linux 基金会治理)。
什么时候用:想让 AI 调用你自己的系统 / 数据 / 工具时,首选 MCP。
A2A (Agent-to-Agent)
Agent-to-Agent Protocol
Agent 之间的通信协议,让多个智能体互相"对话 / 派活 / 交结果"。和 MCP 互补:一个接工具,一个连 Agent。
什么时候用:要构建"多个 Agent 协同"的系统时。
Skill 技能
Skill
把某类能力(如"生成 PPT""查数据库")打包成可复用模块,Agent 需要时直接调用,不用每次重新教。
什么时候用:想把常用能力沉淀下来、给多个 Agent 共享时。
Dify
Dify
开源的 AI 应用开发平台,可视化搭工作流 / Agent / 知识库。本路线的核心练习场,本地用 Docker 就能跑。
什么时候用:不想写一堆代码、想快速把 AI 应用搭起来时。
Cherry Studio
Cherry Studio
桌面端多模型客户端,适合日常对话、提示词调试和多模型对比。提示词学习的"实验场"。
什么时候用:想方便地在多个模型间切换、对比效果时。
Docker
Docker
把应用连同运行环境打包成"容器",一条命令到处跑,避免"在我电脑上是好的"。
什么时候用:本地部署 Dify 等开源 AI 工具时基本都靠它。
Vibe Coding
Vibe Coding
"用自然语言描述需求、让 AI 写代码"的开发方式,边聊边改,重结果轻过程。2026 年 AI 编程的主流形态。
什么时候用:快速出原型、或非程序员想做小工具时。
LLMOps
LLMOps
大模型应用的运维实践:监控效果、评测质量、持续迭代、控制成本的一整套方法论。
什么时候用:AI 应用要上线、长期稳定跑时,不能只管"跑通"。