TRANSFORMER FACTORY · WORKSHOP 01
Tokenizer 加工厂
自然语言沿传送带依次经历规则识别、Token 切分、ID 编码与 Embedding 向量化
规则识别结果0 UNIT
等待原料进入扫描舱
TOKEN ID 编码器VOCAB MAP
等待 Token 输入
自然语言原料已装载
RAW MATERIAL / 01
01RAW MATERIAL
自然语言是加工原料
模型不会直接处理汉字、单词和标点。第一步只是把完整文本放上生产线,文本还没有被切成 Token。
文本 → Unicode 字符序列
KNOWLEDGE WORKSHOP · 02
TOKEN GRANULARITY CONTROL CENTER
Tokenizer 分词策略实验室
同一段文字可以按词、字符或子词加工。切得越细,词表越容易覆盖;切得越粗,序列通常越短。现代大模型常在两者之间选择 Subword。
核心权衡
词表规模↔序列长度↔未知词
互动原料台LIVE SEGMENTATION
SUBWORD FOUNDRY · FOUR PROCESS ROUTES
Subword 四种加工路线
点击算法卡片,观察同一个词如何经历合并、匹配或概率剪枝。
ROUTE 01
BPE · Byte Pair Encoding
从字符或基础符号开始,统计训练语料中最常见的相邻对,将其合并成新符号;重复直到达到目标词表规模。
最终教学示意
真实结果由模型自己的 merge rules 与词表决定。
概念校准:SentencePiece 是什么?
SentencePiece 不是第五种独立算法。它是一个可直接从原始句子训练、语言无关的 tokenizer 工具框架,原生实现了 BPE 与 Unigram;常用 ▁ 显式表示空格,因此很适合中文、日文等不依赖空格分词的场景。
三种粒度一眼看懂
没有绝对最好的切法,只有与语料、语言和模型目标更匹配的方案。
方案基本单位词表规模序列长度未知词典型问题
Word-based完整词大短高新词、拼写变化导致 OOV
Character-based字符 / 码点小~中长低计算量上升,单个 Token 语义弱
Subword-based高频片段 + 小单元兜底中中很低需要训练词表,模型之间切分不同
“低 OOV”不代表所有系统都绝对没有未知 Token;是否完全覆盖取决于基础字母表、字节回退、规范化规则与特殊 Token 配置。