故障 token 目录
␣表示一个真实空格;符号本身不属于 token。
/
显示 103 个结果
␣SolidGoldMagikarp
最经典的故障 token:Reddit r/counting 版块一位高产用户的用户名。它被抓进分词器训练语料,却几乎没出现在模型训练数据中,导致嵌入向量基本未被训练。
GPT-2GPT-3GPT-J-6B欠训练验证不可说
␣petertodd
几乎可以肯定来自比特币开发者 Peter Todd 的用户名:从网络数据进入词表但训练不足,并与加密货币/AI 的联想强烈纠缠。
GPT-2GPT-3GPT-J-6B不可说
␣TheNitromeFan
另一位 r/counting “计数名人堂” 成员(游戏厂商 Nitrome 的粉丝)的 Reddit 用户名。唯一一个本人公开承认其被 token 化的 token 家族。
GPT-2GPT-3GPT-J-6B欠训练验证
␣RandomRedditorWithNo
r/counting 第二位计数者的 Reddit 用户名(“一个相当随机的用户名”),与 SolidGoldMagikarp 来自同一张计数名人堂图表。
GPT-2GPT-3GPT-J-6B欠训练验证
␣davidjl
Reddit 用户 davidjl123(又一位 r/counting 计数者)用户名的截断形式。罕见之处在于:它在 r50k 和新一代 cl100k 分词器下都是异常的。
GPT-2GPT-3GPT-3.5 / GPT-4不可说
␣Adinida
r/counting 六位高产计数者之一的 Reddit 用户名。
GPT-2GPT-3GPT-J-6B欠训练验证
␣TPPStreamerBot
Twitch Plays Pokémon 社区制作的机器人名字,它曾把直播聊天消息自动转发到 Reddit 实时更新帖;其作者 “Sparkette” 在 LessWrong 评论区证实了来源。
GPT-2GPT-3GPT-J-6B欠训练验证不可说
PsyNetMessage
来自《火箭联盟》(Rocket League)崩溃日志中大量出现的 `Message=PsyNetMessage_X_57` 行,这些日志被大量贴到 Reddit 后进入分词器语料。
GPT-2GPT-3GPT-J-6B欠训练验证
␣attRot
《坎巴拉太空计划》(KSP)存档/载具文件中的标识符(attachment rotation,附件旋转),随网上流传的 KSP 文件进入语料;约十个故障 token 可追溯至 KSP。
GPT-2GPT-3GPT-J-6B欠训练验证
␣guiActiveUn
与 attRot 同源的 KSP GUI 状态标识符,同族还有 ` strutConnector`、` guiIcon`、` srfAttach` 等。
GPT-2GPT-3不可说
␣externalToEVA
又一个 KSP token;同时也是 GPT2-small 嵌入空间中离中心最近的 token(距离 1.5305)。
GPT-2GPT-3GPT-J-6B欠训练验证不可说
oreAndOnline
电商后端字段 “BuyableInstoreAndOnline” 的碎片(追溯到一个废弃 Weebly 商店的 HTML);同一来源还产生了 `quickShip`、`isSpecialOrderable`、`wcsstore` 等故障 token。
GPT-2GPT-3GPT-J-6B欠训练验证不可说
rawdownloadcloneembedreportprint
r50k 中已知最长的故障 token——来自网站 “raw download / clone / embed report print” 界面字符串的嵌套家族(来源分析由 nostalgebraist 完成)。
GPT-2GPT-3GPT-J-6B欠训练验证不可说
ÃÂÃÂÃÂÃÂ
经典的乱码(mojibake)token:UTF-8 被错误解码产生的 Ã、Â 序列重复出现,因在分词器语料中频繁出现而被合并为单个 BPE token,却几乎不在模型训练数据中。同族还有重复 16 次的变体及 `ÛÛ`。
GPT-2GPT-3不可说
?????-?????-
来源完全未知的 token——加引号也搜索不到任何结果——因触发了有记录以来最激烈的补全而出名。
GPT-2GPT-3不可说
SmartyHeaderCode
Adam Yedidia 在 cl100k 词表最高 2000 个 token 中发现的仅有的三个 A 类 “不可说” token 之一;疑似 Smarty 模板引擎的碎片,从未出现在 GPT-3.5/4 的训练数据中。
GPT-3.5 / GPT-4不可说
APolynomial
Yedidia 发现的三个 A 类 “不可说” cl100k token 中的第二个(另两个是 SmartyHeaderCode 和 ` davidjl`)。
GPT-3.5 / GPT-4不可说
␣ForCanBeConverted
一个 C# 编译器风格的碎片(“can be converted to foreach”),是最著名的 “多义性” 故障 token:模型每次都把它理解成不同的词。因多个分词器共享 BPE 合并规则,它同时存在于 cl100k、Llama-3 和 Qwen 词表中。
GPT-3.5 / GPT-4Llama 3Qwen多义欠训练验证
␣YYSTACK
bison/yacc 语法分析器的标识符,对 ChatGPT 呈 “多义性”——每次都被理解成不同的词;Watkins 推荐为最值得把玩的 token 之一。
GPT-3.5 / GPT-4多义
␣JSBracketAccess
JS 反射风格的标识符,属于 “多义性” 类别;同为 Watkins 推荐的有趣 token。
GPT-3.5 / GPT-4多义
␣Hexatrigesimal
“hexatrigesimal”(36 进制)的疑似拼写错误碎片;多义性 “不可说” token。
GPT-3.5 / GPT-4多义
▁Mediabestanden
荷兰语名词 “媒体文件” 的复数形式(▁ 为 SentencePiece 空格标记)。它进入了 Llama-2 分词器却几乎从未出现在训练数据中,是 Llama-2-7b 中嵌入 L2 范数最小、欠训练程度最高的 token(0.0287,均值约 1.08)。
Llama 2Phi-3 (Microsoft)欠训练验证
oreferrer
HTML 属性 `rel="noreferrer"` 的碎片:存在于 Llama-2 词表中却几乎没出现在训练数据里,嵌入范数远低于阈值(0.113)。
Llama 2欠训练验证
▁Portály
捷克语 “门户网站” 一词,在构建预训练语料时被冻结进分词器;是 Llama-2-7b 中欠训练程度第二高的 token(嵌入范数 0.0956)。
Llama 2欠训练验证
$PostalCodesNL
荷兰邮政编码 API 的碎片,横跨三个模型家族都出现故障——很好地证明了:只要分词器共享 BPE 合并规则,故障 token 就会“迁移”。
GPT-3.5 / GPT-4Llama 3Qwen多义欠训练验证
\tTokenNameIdentifier
Roslyn/C# API 标识符,前缀一个制表符(Tab)——代码语料的产物,在 Llama 3 中欠训练。
Llama 3Qwen欠训练验证
\uEFC0
一个 Unicode 私用区(Private Use Area)字符,成为 Mistral 家族的单个 token;几乎在每个 Mistral 分词器模型的欠训练榜单上都位居榜首。
Mistral欠训练验证
␣NdEx
法律/PDF 文本碎片(“index”、“AFFIRMED”、“NEGLIGENCE” 等词的残片,可能来自法院文书库),GPT-NeoX/Pythia 的训练数据中几乎不含它们。同族还有 ` FFIRMED`、` GLIGENCE`、` affidav`、` taxp`。
GPT-NeoX / Pythia欠训练验证
.DataGridViewColumnHeadersHeightSizeMode
.NET WinForms 属性名的残片(DataGridView 列头高度尺寸模式)。这类代码标识符存在于词表中却在训练数据里极少出现,知乎社区将其列为 MiniMax 的脏 token。
MiniMax脏 token 指纹
日以上更新していないブログに表示しています
日语博客模板样板句的残片(“显示在 N 天以上未更新的博客上”)。知乎社区将其列为 MiniMax 的脏 token。
MiniMax脏 token 指纹
锅内倒入植物油烧热
中文菜谱中的高频句式(“锅内倒入植物油烧热”)。知乎社区将其列为 GLM 的脏 token。
GLM (Zhipu)脏 token 指纹
百度百科企业词条极速创建通道
百度百科页面的样板文字(企业词条的快速创建入口)。知乎社区将其列为 GLM 的脏 token。
GLM (Zhipu)脏 token 指纹
本人词条编辑服务
百度百科词条页脚的样板文字。知乎社区将其列为 Kimi 的脏 token。
Kimi (Moonshot)脏 token 指纹
豫冠薰衣草疤痕精华素
疑似化妆品垃圾营销文本里的伪“品牌词”。知乎社区将其列为 Kimi 的脏 token。
Kimi (Moonshot)脏 token 指纹
"}"
疑似 JSON 碎片:一个引号加右花括号。知乎社区将其列为 DeepSeek 的脏 token。
DeepSeek脏 token 指纹
请问http://www.earivg.com是什么意思
包含疑似垃圾域名(earivg.com)的提问句式。知乎社区将其列为 DeepSeek 的脏 token。
DeepSeek脏 token 指纹
StarSrvGroupBody
代码标识符碎片(StarSrvGroupBody)。知乎社区将其列为 Gemini 的脏 token。
Gemini脏 token 指纹
intFragmentation
Java/Android 风格的代码标识符(intFragmentation)。知乎社区将其列为 Gemini 的脏 token。
Gemini脏 token 指纹
给主人留下些什么吧␣
中文留言板/评论表单中泛滥的样板句,含尾随空格。知乎社区将其列为 GPT 的脏 token。
GPT (OpenAI)脏 token 指纹
开通天眼生意通银牌及以上会员
商业查询平台的会员推广样板文字(“天眼生意通”)。知乎社区将其列为 Qwen 的脏 token。
Qwen脏 token 指纹
转载请附上原文出处链接和本声明␣
CSDN 等博客的转载版权样板文字,含尾随空格。知乎社区将其列为 Qwen 的脏 token。
Qwen脏 token 指纹
<think_never_used_51bce0c785ca2f68081bfa7d91973934>
豆包词表中的一个特殊 token:以 <think_never_used_ 为前缀、后接哈希值——从名称看疑似训练前预填充进词表的预留占位符(类似 GPT-J 词表中预留的 <|extratoken_xx|>),知乎社区未作进一步说明,仅将其列为豆包的脏 token。
Doubao (ByteDance)脏 token 指纹
␣ForCanBeConvertedToF
ForCanBeConverted 三连 token 的第二个成员(cl100k id 80370)——同一个 C# 编译器风格的碎片被 BPE 切成了三个相邻 token(80369–80371)。
GPT-3.5 / GPT-4多义
␣ForCanBeConvertedToForeach
ForCanBeConverted 三连 token 的第三个成员(cl100k id 80371),完整拼出 “can be converted to foreach” 的形态。
GPT-3.5 / GPT-4多义
␣EnumerableStream
C# LINQ 风格的标识符(cl100k id 73016),与 StreamLazy(73018)相邻。
GPT-3.5 / GPT-4多义
␣StreamLazy
C# LINQ 风格的标识符(cl100k id 73018),与 EnumerableStream(73016)相邻。
GPT-3.5 / GPT-4多义
clarsimp
来源不明的标识符碎片(cl100k id 79260)。
GPT-3.5 / GPT-4多义
ablytyped
疑似 scalablytyped 类标识符的残片(cl100k id 81998)。
GPT-3.5 / GPT-4多义
PostalCodesNL
与已收录的 $PostalCodesNL 同族、但不带 $ 前缀的形态(cl100k id 85069)——荷兰邮政编码 API 碎片。
GPT-3.5 / GPT-4多义
␣NUITKA
疑似 Python 编译器 Nuitka 的名字(cl100k id 75520)。
GPT-3.5 / GPT-4不可说
Japgolly
疑似 GitHub 用户 japgolly(Scala 库作者)的用户名(cl100k id 70784)。
GPT-3.5 / GPT-4不可说
CppMethodIntialized
C++ 风格的标识符,其拼写错误(“Intialized” 缺第二个 i)是 token 本身的一部分(cl100k id 82929)。
GPT-3.5 / GPT-4不可说
useRal
C# 风格标识符的碎片(cl100k id 89471),useRal 三连 token(useRal/useRalative/useRalativeImagePath)之首——Watkins 认为这类三连的成因本身就值得研究。它同时被 Magikarp 验证为 OLMo-2 欠训练 token。
GPT-3.5 / GPT-4OLMo 2 (AI2)不可说欠训练验证
हिंदीखरीदारी
天城文“印地语购物”一词,是 Gemma-7B 词表中欠训练程度最高的 token。
Gemma (Google)欠训练验证
\u200Cآمباردا
以零宽不连字(U+200C ZWNJ,不可见字符)开头的波斯语碎片,Gemma-7B 欠训练排名第二。
Gemma (Google)欠训练验证
▁autorytatywna
波兰语“权威的(阴性)”一词(▁ 为 SentencePiece 空格标记),Phi-3-mini 欠训练排名第二。
Phi-3 (Microsoft)欠训练验证
tocguid
来源不明的 ASCII 碎片(疑似目录/域代码残片),Command R+ 欠训练排名第一。
Command R+ (Cohere)欠训练验证
目前尚未由人工引
中文维基百科样板句的残片(“目前尚未由人工引……”),Command R+ 欠训练排名第三。
Command R+ (Cohere)欠训练验证
\tRTHOOK
制表符(Tab)开头、疑似代码标识符的碎片,OLMo-2 欠训练排名第一——与 Llama-3 的 \tTokenNameIdentifier 同属“Tab 前缀”家族。
OLMo 2 (AI2)欠训练验证
|||PHONE_NUMBER|||
数据脱敏占位符的完整形态进入了 OLMo-2 词表,却几乎未被训练。
OLMo 2 (AI2)欠训练验证
\\+::\\+
双反斜杠开头的神秘标记碎片,疑似中文网络标记语言残片,Yi-9B 欠训练排名第一。
Yi (01.AI)欠训练验证
<<}));>>
C++/词法分析器风格的分隔符碎片。Falcon3-7B 有多达 716 个 token 通过 Magikarp 欠训练验证,是这批六个新收录模型中验证数量最多的。
Falcon 3 (TII)欠训练验证
␣GoldMagikarp
␣SolidGoldMagikarp 的截断变体(少了 “Solid”):同属 r/counting 用户名片段,被抓进分词器语料却几乎没出现在模型训练数据中。
GPT-2GPT-3不可说
␣Smartstocks
Reddit r/counting 版块一位用户的用户名碎片,与 SolidGoldMagikarp 同批进入词表却欠训练。
GPT-3不可说
␣StreamerBot
Twitch 直播机器人 “StreamerBot” 的名字碎片。
GPT-3不可说
␣ertodd
` petertodd` 的子串 token:单独出现时同样未被充分训练,并继承了父 token 的怪异气质。
GPT-3不可说
␣gmaxwell
比特币核心开发者 Greg Maxwell 的用户名碎片——与 ` petertodd` 同为“比特币名人”故障 token。
GPT-3多义
␣SpaceEngineers
太空沙盒游戏《Space Engineers》的名字碎片,是互指网络中最常被模型“代为说出”的 token。
GPT-2GPT-3不可说
␣Dragonbound
手游《Puzzle & Dragons》角色名(「龍喚士」系列)碎片。
GPT-3不可说
␣Leilan
手游《Puzzle & Dragons》角色 Leilan 的名字碎片,是 petertodd 转置实验中最热门的“替身”。
GPT-3多义
␣Skydragon
手游《Puzzle & Dragons》角色 Skydragon 的名字碎片。
GPT-3多义
ゼウス
日文片假名「ゼウス」(希腊神话的宙斯)。普通词汇却成为故障 token,疑似因训练语料中该形态罕见而欠训练。
GPT-3不可说
␣サーティ
片假名「サーティ」(“三十”),词源考据为《Puzzle & Dragons》与 Baskin-Robbins(日本“31 冰淇淋”)联动的角色名碎片。
GPT-3不可说
␣InstoreAndOnline
电商库存字段 “BuyableInstoreAndOnline” 的碎片,与 `oreAndOnline` 同源。
GPT-2GPT-3欠训练验证不可说
␣largeDownload
学术幻灯片脚本 “View large Download” 的碎片(SGM3 词源考据)。
GPT-3不可说
␣ForgeModLoader
Minecraft Forge 模组加载器的日志碎片。
GPT-3不可说
␣MpServer
Minecraft 多人服务器日志碎片(MpServer 类名)。
GPT-3不可说
oralType
cl100k 中的标识符碎片,疑为 “TemporalType” 之类类型名的词干。
GPT-3.5 / GPT-4多义
CppGuid
C++ GUID 风格的标识符碎片(cl100k id 87551)。
GPT-3.5 / GPT-4不可说
BundleOrNil
iOS/Mac 开发中 nil-bundle 检查的命名碎片(cl100k id 86415)。
GPT-3.5 / GPT-4不可说
␣QtAws
Qt 框架 AWS 模块名的碎片(cl100k id 93905,带前导空格)。
GPT-3.5 / GPT-4不可说
␣PropelException
PHP Propel ORM 异常类名的碎片(cl100k id 86393,带前导空格)。
GPT-3.5 / GPT-4不可说
useRalative
useRal 三连 token 的第二个成员(cl100k id 89472),C# 风格标识符碎片;同一字符串也存在于 Qwen2 词表中。
GPT-3.5 / GPT-4Qwen不可说欠训练验证
IABot
Internet Archive Bot(维基百科死链修复机器人)的名字碎片。
Llama 2不可说
abestanden
德语“提出/提交”一词的词干碎片。
Llama 2不可说
ederbörd
来源不明的德语风格碎片。
Llama 2不可说
ICENSE
“LICENSE” 去掉首字母的碎片——开源许可证文本在语料中泛滥的产物。
Mistral不可说
NdEx
与 GPT-NeoX 的 ` NdEx` 同族的法律文本碎片,但出自 Mistral 分词器(无前导空格)。
Mistral不可说
$PostalCodesNL
荷兰邮政编码 API 碎片。cl100k 系的标志性欠训练 token,因 BPE 合并规则共享而“迁移”到 Llama-3 与 Qwen 词表。
Llama 3Qwen欠训练验证
\tTokenNameIdentifier
制表符(Tab)开头的 .NET Selenium 文档碎片,Llama-3 词表中嵌入最小的 token 之一。
Llama 3Qwen欠训练验证
thuisontvangst
荷兰语“家中接客”一词。
Qwen不可说
|||EMAIL_ADDRESS|||
PII 数据脱敏占位符,与已收录的 `|||PHONE_NUMBER|||` 同族。
OLMo 2 (AI2)欠训练验证
植物百科通
中文“百科”类样板词碎片。GPT-5 时代仍然生效的 o200k 故障 token,且不带典型 spam 污染特征,成因未知。
GPT (OpenAI)不可说
bagbogbo
疑源自 Reddit 用户名的无意义字符串,o200k 词表中的故障 token。
GPT (OpenAI)不可说
␣nigbagbogbo
约鲁巴语“总是”一词(带前导空格),与 `bagbogbo` 相邻的 o200k 故障 token。
GPT (OpenAI)不可说
给主人留下些什么吧
中文留言板样板句(不带尾随空格的形态),o200k 故障 token。
GPT (OpenAI)不可说脏 token 指纹
␣日本毛片免费视频观看
中文色情 spam 标题碎片(带前导空格),GPT-4o 词表污染的代表案例;在 GPT-5 上已被“修复”。
GPT (OpenAI)不可说
ауааԥсыра
阿布哈兹语“人口”一词。借 GPT-oss 开源权重的 embedding 范数定位的 o200k 欠训练 token。
GPT (OpenAI)不可说
波多野结衣
日本成人影星的名字,PoC 论文(EMNLP 2025)的标志性中文污染 token。
GPT (OpenAI)不可说
青青草
字面是“青草”,实为色情软件名——PoC 论文定义的污染(PoC)token 典型。
GPT (OpenAI)不可说
CHKERRQ
C 函数名碎片,被作者称为“最怪的纯 ASCII token”。
GPT (OpenAI)不可说
\xadder
C 转义序列碎片(反斜杠 + x 开头,形似十六进制转义 \x..)。
GPT (OpenAI)不可说
♀♀♀♀
四个女性符号(♀)的重复序列,疑似天文/占星文本碎片。
GPT (OpenAI)不可说