名词解释教学工作区 · 课程 0022 · 形态 单概念 · 约 6 分钟 · 前置:0013 · 前端 / 后端 / 接口(模型大多以接口的形式供你调用) · 相关:0019 · SaaS · 0021 · 爬虫 · 2026-10-01

LLM:它只是在猜下一个词,猜得足够准就成了通用工具

你能做到:拿到一段想让它替你干的文本活,先判断三件事 —— 它需要的事实是不是都在你给的材料里、错了有没有代价、这活值不值得按词元付费; 再决定是直接写提示词问它、给它接一层检索,还是干脆换个办法。

1 | 定义

大语言模型(Large Language Model,缩写 LLM,口语里常叫"大模型"): 用海量文本训练出的一套神经网络 neural network参数。它先把一句话切成一个个 词元 token,算出「在这个上下文里,下一个词元最可能是什么」的概率分布, 再一个词元一个词元地往下接;参数多到几十亿、几千亿级,所以叫"大"。 像读完海量文字之后只学会一件事:下一个字最可能是什么。你起个头,它就能顺着你的话往下写; 它没有在"想",只是在极快地接着猜 —— 但猜得足够准,就能当翻译、当助手、当写代码的搭档。

2 | 它解决什么麻烦

这几类活有同一个特点:用固定规则写不出来,或者写出来也维护不起。

3 | 它怎么解决

从一段文字进来,到一段文字出去,中间是一条固定的流水线:

文本 你给的问题与材料 -> 分词 tokenizer 切成一个个词元 -> Transformer 网络 用自注意力看清词与词的关系 -> 下一个词元的概率 整个词表上的一张分布 -> 采样 sampling 按分布抽一个,而不是死拿最高的 -> 自回归 autoregressive 生成的词元再加回输入,接着猜下一个

4 | 用它的代价

5 | 真实使用场景

场景一:代码助手。在编辑器里写代码的搭档(GitHub Copilot、ChatGPT、Claude)基本就是这一件事: 你写下注释或半个函数,它接着往下补;看不懂的报错贴给它,它给一个改法。它最值钱的地方是省掉查文档那几步, 最需要提防的,是它自信地编出一个根本不存在的函数名。

场景二:文档问答,先检索再作答。想让答案有依据,做法是先检索、再生成,也就是 检索增强生成 RAG(Retrieval-Augmented Generation):

# 1) 把文档切块,算成向量存进检索库(建一次)
# 2) 提问时先检索出最相关的几块原文
# 3) 把"问题 + 这几块原文"一起交给模型,并要求它只依据原文作答、给出出处

答案合不合用,一半取决于检索有没有把对的原文找出来 —— 找错了材料,模型会照着错的材料写得头头是道。

场景三:批量处理非结构化文本。把工单分门别类、把会议记录压成要点、从合同里抽出金额与期限: 过去每种任务都要单独标注数据、训一个专用模型,现在一套接口加一段提示词就能先跑起来,再按错例慢慢改提示词。

场景四:在 agent 里当"大脑"。模型负责理解目标、决定下一步调哪个工具,工具去真正执行 (查网页、跑代码、读写文件),结果再送回来让它判断下一步 —— 模型 + 工具 + 循环,这就是常说的 AI agent。 动手前先看清它本质上是个 HTTP 服务:一次 POST,就是一次问答。

curl https://api.openai.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-4o-mini","messages":[{"role":"user","content":"用一句话解释什么是大语言模型"}]}'

地址、请求头、请求体都是这套 接口(API)的约定: 你把 messages 交进去,它把生成的那段文字放进响应还回来。厂商托管模型、按用量卖给调用方,又是标准的 SaaS 形态 —— 软件与算力都在对方那边。

6 | 和相近的东西怎么分

先问一句:它输出的是"一个判定",还是"一段像人写的文字"? 再问一句:和它一起干活的,是别的软件,还是你自己的输入?

名称它是什么和 LLM 什么关系
传统机器学习模型 从带标签的数据里学一个"输入→输出"的判定或数值,比如判断邮件是不是垃圾、预测房价 同一家族的窄版本:一个模型只做一件定好的事,便宜、好解释;LLM 是"文本接龙"通吃,精确判定反而常交给传统模型
生成式 AI(generative AI) 从学到的分布里"生成"新内容的模型总称,文字、图片、音频、视频都算 它是更大的类:LLM 只是其中管文字的那一支,画图、配音的那些和它同族、只是模态不同
多模态模型(multimodal model) 同时能读文字、图像、音频等好几种输入的模型 LLM 起步只处理文字;把别的模态接进来,就得到多模态模型 —— 底座往往还是同一个
AI agent(智能体) 不只答话,还会自己决定调哪个工具、看结果、再决定下一步的程序 LLM 常是它的"大脑",外面再套一层"工具 + 循环";单问单答的 LLM 还算不上 agent
检索增强生成 RAG 先在你的资料里检索出相关片段,再把这些片段和问题一起交给模型,要求它照材料回答 不是另一种模型,是给 LLM 补的"外挂记忆":专治窗口里没有、训练里也没学过的事实问题
小语言模型与蒸馏(SLM / distillation) 参数量小得多的语言模型;蒸馏是让大模型当老师,把"怎么答"教给小模型 同一条路线的省钱版:任务够单一或数据要保密时,小模型更快、更便宜,也能放到本地跑

一句话分工:传统模型管"判定",LLM 管"生成";要它别乱答就外挂检索(RAG),要它去干活就套成 agent, 嫌贵嫌慢就蒸馏成小模型。

7 | 常见误解

8 | 练习

三题自测,每题只有一个正确选项;选完立刻看到解释。

1. 模型在生成一段回答时,每一步实际在做的是什么?

对。整条流水线只做一件事:按上下文算出下一个词元的概率再抽一个,抽出来的词元再加回输入接着猜;没有任何一步在查资料或核对事实 —— 幻觉就是这么来的。

2. 想让回答只依据你给的那几份文档、并且给出处,该上哪一样?

对。RAG 把"检索"和"生成"接成一步:先把相关原文找出来,连同问题一起交给模型,再要求它照材料作答、标出来源 —— 模型本身没变,变的是喂给它的材料。

3. 同一个问题问两次,得到的回答不一样,最直接的原因是什么?

对。生成时不是每次死拿概率最高的词元,而是按分布抽签;temperature 一调高,抽中的就更随机,两次回答自然不同。分词与预训练决定它怎么学、怎么切文本,不解释这次为什么不重样。