跳转到内容

什么是 LLM

刀刀
0字
0分钟
8/18/2026

概念

LLM 是一种通过海量数据训练出来的大语言模型,能理解上下文,并通过预测下一个 Token 来生成自然语言内容。

LLM

Transformer 架构是什么

Google 最初提出 Transformer,是为了改进机器翻译等序列建模任务;后来大家发现它不仅适合翻译,还特别适合语言理解、文本生成,最终发展成 LLM 这种大模型的核心架构,现在主流 LLM 大多使用 Transformer 架构。

Transformer 其实就是在不断的预测下一个最可能出现的 Token。 比如这句话:

txt
中国的首都是()

['上海', '北京', '杭州']

中国的首都是(北京)

再比如这句:

txt
你好,我喜欢()

['你', '狗']

你 -> 60%
狗 -> 40%

你好,我喜欢你

可能因为你比狗强,大模型选择了你。

其实就是一直找概率最高的那个 token,往后拼接。

模型不会直接把它当成一整句话处理,而是会先切成 Token。

Token 是什么

Token 是模型读取和生成文本的最小片段单位。它可能是一个字、一个词、半个词、标点、空格等。

我们可以先把《你好,我喜欢你》粗略看成 5 个 Token:

顺序Token
1你好
2
3
4喜欢
5

token拆分

LLM 生成这句话时,也不是一次性把整句话写出来,而是一个 Token 一个 Token 地往后生成。还是以上面例子为例,后续可能还会有其他的 Token,如《你好,我喜欢你的狗》。

不同模型通常会使用不同的 tokenizer,也就是不同的分词/切词规则。所以同一段文字,在不同模型里可能会被切成不同数量的 token。

贡献者

The avatar of contributor named as duyidao duyidao

页面历史

刀刀博客累计访客 人;文档累计访问量共