TRANSFORMER FACTORY · WORKSHOP 01

Tokenizer 加工厂

自然语言沿传送带依次经历规则识别、Token 切分、ID 编码与 Embedding 向量化

规则识别结果0 UNIT

等待原料进入扫描舱

TOKEN ID 编码器VOCAB MAP

等待 Token 输入

Embedding 向量化DENSE VECTOR

输入 ID:—

自然语言原料已装载 RAW MATERIAL / 01
01RAW MATERIAL

自然语言是加工原料

模型不会直接处理汉字、单词和标点。第一步只是把完整文本放上生产线,文本还没有被切成 Token。

    文本 → Unicode 字符序列
    深入分词策略 ↓
    KNOWLEDGE WORKSHOP · 02

    TOKEN GRANULARITY CONTROL CENTER

    Tokenizer 分词策略实验室

    同一段文字可以按词、字符或子词加工。切得越细,词表越容易覆盖;切得越粗,序列通常越短。现代大模型常在两者之间选择 Subword。

    核心权衡 词表规模序列长度未知词
    互动原料台LIVE SEGMENTATION
    输出 0 个 Token 兼顾词表覆盖与序列长度 词 / 子词 / 字符 → 固定词表
    SUBWORD FOUNDRY · FOUR PROCESS ROUTES

    Subword 四种加工路线

    点击算法卡片,观察同一个词如何经历合并、匹配或概率剪枝。

    ROUTE 01

    BPE · Byte Pair Encoding

    从字符或基础符号开始,统计训练语料中最常见的相邻对,将其合并成新符号;重复直到达到目标词表规模。

    最终教学示意

    真实结果由模型自己的 merge rules 与词表决定。

    概念校准:SentencePiece 是什么?

    SentencePiece 不是第五种独立算法。它是一个可直接从原始句子训练、语言无关的 tokenizer 工具框架,原生实现了 BPE 与 Unigram;常用 显式表示空格,因此很适合中文、日文等不依赖空格分词的场景。

    QUICK COMPARISON

    三种粒度一眼看懂

    没有绝对最好的切法,只有与语料、语言和模型目标更匹配的方案。

    方案基本单位词表规模序列长度未知词典型问题
    Word-based完整词新词、拼写变化导致 OOV
    Character-based字符 / 码点小~中计算量上升,单个 Token 语义弱

    “低 OOV”不代表所有系统都绝对没有未知 Token;是否完全覆盖取决于基础字母表、字节回退、规范化规则与特殊 Token 配置。