iPhone 变身 MacBook 第二块 GPU

24GB 统一内存的 MacBook Pro 跑 270 亿参数的大模型,瓶颈很快撞上内存墙。一位开发者的解法相当离谱:把 iPhone 17 Pro Max 用 USB-C 插上去,借它的芯片一起算。实验数据显示,这台”外接显卡”能把本地大模型的预填充(Prefill)速度最多拉高 44%。
方案的核心是流水线分工。每处理 256 个 Token 的一批数据,MacBook Pro 负责第 1 层到第 40 层的计算,然后把中间激活数据实时传给 iPhone;iPhone 17 Pro Max 调用 A19 Pro 芯片里的 GPU 接着算第 41 层到第 64 层,与此同时 Mac 已经开始处理下一批。两台设备由此同时参与推理,而不是互相等待。
在 Qwen3.8-27B 模型上,不同上下文窗口的提升幅度分别是:8K 上下文下,处理速度从每秒 132 个 Token 提到 177 个,增幅 35%;16K 上下文下从每秒 109 个提到 157 个,增幅 44%;32K 上下文下从每秒 101 个提到 130 个,增幅约 29%。
A19 Pro 的神经网络引擎也在其中打辅助:开发者把每 16K 的历史上下文转换成一个专用神经网络来处理。在 14 万 Token 的超长上下文场景下,单个 Token 的写入时间从纯 GPU 方案的 279 毫秒缩短到 176 毫秒。
不过这项实验的边界也很清楚。iPhone 主要提速的是预填充阶段,64K 以内的文本生成任务,重活仍然由 Mac 自己干;整套方案依赖专门开发的软件,普通用户没法直接拿来用。但至少它说明了一件事:手机、平板、电脑这几台消费级设备凑在一起跑本地大模型,工程上是走得通的。