经典的乱码(mojibake)token:UTF-8 被错误解码产生的 Ã、Â 序列重复出现,因在分词器语料中频繁出现而被合并为单个 BPE token,却几乎不在模型训练数据中。同族还有重复 16 次的变体及 `ÛÛ`。
"ÃÂÃÂÃÂÃÂ"
r50k_base