揭秘iPhone里的Transformer：基于GPT-2架构，分词器含emoji，MIT校友出品

时间:2023-09-18 来源:区块链网络作者:AIGC

原文来源：量子位

图片来源：由无界 AI? 生成

苹果Transformer的“秘密”，让发烧友给扒出来了。

大模型浪潮下，即使保守如苹果，也每逢发布会必提“Transformer”。

比如，在今年的WWDC上，苹果就已宣布，船新版本的iOS和macOS将内置Transformer语言模型，以提供带文本预测功能的输入法。

苹果官方没有透露更多信息，但技术爱好者们可坐不住了。

一位名叫Jack Cook的小哥，就把macOS Sonoma beta翻了个底朝天，结果，还真挖出不少新鲜信息：

模型架构上，Cook小哥认为苹果的语言模型更像是基于GPT-2打造的。在分词器（tokenizer）方面，表情符号在其中十分突出。

更多细节，一起来看。

基于GPT-2架构

先来回顾一下苹果基于Transformer的语言模型能在iPhone、MacBook等设备上实现怎样的功能。

主要体现在输入法方面。语言模型加持下的苹果自带输入法，可以实现单词预测和纠错的功能。

Jack Cook小哥具体测试了一下，发现这个功能主要实现的是针对单个单词的预测。

△图源：Jack Cook博客文章

模型有时也会预测即将出现的多个单词，但这仅限于句子语义十分明显的情况，比较类似于Gmail里的自动完成功能。

△图源：Jack Cook博客文章

那么这个模型具体被装在了哪里？一通深入挖掘之后，Cook小哥确定：

我在 /System/Library/LinguisticData/RequiredAssets_en.bundle/AssetData/en.lm/unilm.bundle 中找到了预测文本模型。

原因是：

unilm.bundle中的许多文件在macOS Ventura（13.5）里并不存在，仅出现在了新版本macOS Sonoma beta（14.0）里。unilm.bundle中存在一个sp.dat文件，这在Ventura和Sonoma beta里都能找到，但Sonoma beta的版本中更新了明显像是分词器的一组token。sp.dat中token的数量跟unilm.bundle中的两个文件——unilm_joint_cpu.espresso.shape和unilm_joint_ane.espresso.shape能匹配得上。这两个文件描述了Espresso/CoreML模型中各层的形状。

进而，小哥根据unilm_joint_cpu中描述的网络结构，推测苹果模型是基于GPT-2架构打造的：

主要包含token embeddings、位置编码、解码器块和输出层，每个解码器块中都有类似gpt2_transformer_layer_3d这样的字眼。