TRANSFORMER FACTORY · WORKSHOP 01

Tokenizer 加工厂

自然语言沿传送带依次经历规则识别、Token 切分、ID 编码与 Embedding 向量化

规则识别结果0 UNIT

等待原料进入扫描舱

TOKEN ID 编码器VOCAB MAP

等待 Token 输入

Embedding 向量化DENSE VECTOR

输入 ID:—

自然语言原料已装载 RAW MATERIAL / 01
01RAW MATERIAL

自然语言是加工原料

模型不会直接处理汉字、单词和标点。第一步只是把完整文本放上生产线,文本还没有被切成 Token。

    文本 → Unicode 字符序列
    深入分词策略 ↓
    KNOWLEDGE WORKSHOP · 02

    TOKEN GRANULARITY CONTROL CENTER

    Tokenizer 分词策略实验室

    同一段文字可以按词、字符或子词加工。切得越细,词表越容易覆盖;切得越粗,序列通常越短。现代大模型常在两者之间选择 Subword。

    核心权衡 词表规模序列长度未知词
    互动原料台LIVE SEGMENTATION
    输出 0 个 Token 兼顾词表覆盖与序列长度 词 / 子词 / 字符 → 固定词表
    SUBWORD FOUNDRY · TRAINABLE MINIATURE ENGINE

    Subword 可训练小型实验机

    输入迷你训练语料并设定训练轮数,单步观察 Pair 合并或候选剪枝;这里展示的是训练过程,而不只是最终切分结果。

    ROUTE 01

    BPE · Byte Pair Encoding

    统计训练语料中最常见的相邻对,每轮把胜出的 Pair 合并为新 Token。

    已完成00 当前词表--Token 剩余动作14
    等待装料
    当前语料切分状态CORPUS SEGMENTS

    点击“初始化”,把语料送入训练机。

    高频 Pair 排行FREQUENCY

    尚无统计数据

    如何读这台机器:BPE / Byte-level BPE 每轮选择出现次数最多的相邻 Pair;WordPiece 实验路线比较 Pair 频次与组成符号频次的比值;Unigram 从大候选词表出发,逐个移除使语料负对数似然上升最少的候选。后两者为适合课堂观察的微型近似实现,界面会明确显示评分依据。

    概念校准:SentencePiece 是什么?

    SentencePiece 不是第五种独立算法。它是一个可直接从原始句子训练、语言无关的 tokenizer 工具框架,原生实现了 BPE 与 Unigram;常用 显式表示空格,因此很适合中文、日文等不依赖空格分词的场景。

    QUICK COMPARISON

    三种粒度一眼看懂

    没有绝对最好的切法,只有与语料、语言和模型目标更匹配的方案。

    方案基本单位词表规模序列长度未知词典型问题
    Word-based完整词新词、拼写变化导致 OOV
    Character-based字符 / 码点小~中计算量上升,单个 Token 语义弱

    “低 OOV”不代表所有系统都绝对没有未知 Token;是否完全覆盖取决于基础字母表、字节回退、规范化规则与特殊 Token 配置。