TRANSFORMER FACTORY · WORKSHOP 01
Tokenizer 加工厂
自然语言沿传送带依次经历规则识别、Token 切分、ID 编码与 Embedding 向量化
规则识别结果0 UNIT
等待原料进入扫描舱
TOKEN ID 编码器VOCAB MAP
等待 Token 输入
自然语言原料已装载
RAW MATERIAL / 01
01RAW MATERIAL
自然语言是加工原料
模型不会直接处理汉字、单词和标点。第一步只是把完整文本放上生产线,文本还没有被切成 Token。
文本 → Unicode 字符序列
KNOWLEDGE WORKSHOP · 02
TOKEN GRANULARITY CONTROL CENTER
Tokenizer 分词策略实验室
同一段文字可以按词、字符或子词加工。切得越细,词表越容易覆盖;切得越粗,序列通常越短。现代大模型常在两者之间选择 Subword。
核心权衡
词表规模↔序列长度↔未知词
互动原料台LIVE SEGMENTATION
SUBWORD FOUNDRY · TRAINABLE MINIATURE ENGINE
Subword 可训练小型实验机
输入迷你训练语料并设定目标词表,单步观察 Pair 合并或候选剪枝;这里展示的是训练过程,而不只是最终切分结果。
ROUTE 01
BPE · Byte Pair Encoding
统计训练语料中最常见的相邻对,每轮把胜出的 Pair 合并为新 Token。
ROUND00
VOCAB--
TARGET28
等待装料
尚无统计数据
本轮机械动作STANDBY
初始化后,每一轮的选择依据会显示在这里。
如何读这台机器:BPE / Byte-level BPE 每轮选择出现次数最多的相邻 Pair;WordPiece 实验路线比较 Pair 频次与组成符号频次的比值;Unigram 从大候选词表出发,逐个移除使语料负对数似然上升最少的候选。后两者为适合课堂观察的微型近似实现,界面会明确显示评分依据。
概念校准:SentencePiece 是什么?
SentencePiece 不是第五种独立算法。它是一个可直接从原始句子训练、语言无关的 tokenizer 工具框架,原生实现了 BPE 与 Unigram;常用 ▁ 显式表示空格,因此很适合中文、日文等不依赖空格分词的场景。
三种粒度一眼看懂
没有绝对最好的切法,只有与语料、语言和模型目标更匹配的方案。
方案基本单位词表规模序列长度未知词典型问题
Word-based完整词大短高新词、拼写变化导致 OOV
Character-based字符 / 码点小~中长低计算量上升,单个 Token 语义弱
Subword-based高频片段 + 小单元兜底中中很低需要训练词表,模型之间切分不同
“低 OOV”不代表所有系统都绝对没有未知 Token;是否完全覆盖取决于基础字母表、字节回退、规范化规则与特殊 Token 配置。