100 万像素就够了?代码揭开苹果随身 AI 的取舍

带摄像头的 AirPods 概念图

最新挖出的系统代码,第一次揭示了苹果下一代耳机视觉模块的工作参数:采集分辨率最低只有 320×320。在手机比拼 2 亿像素的今天,这个看似寒酸的数字,藏着苹果对随身 AI 更深的一盘棋。

代号 B790,摄像头只有 100 万像素

此前有开发者从 macOS Tahoe 26.7 RC 里挖出了苹果制作好的演示素材:戴着耳机拿起一本书,Visual Intelligence 识别出书名,再让 Siri 把它保存下来。这段素材对应的产品代号是 B790。按照 Mark Gurman 的说法,它原本就在苹果 2026 年的产品路线图上,后续量产版本 B798 则要等到 2027 年。

macOS 26.7 RC 中挖出的带摄像头 AirPods 宣传视频画面
从系统文件里挖出的宣传视频:AirPods 看见书名,Siri 负责保存

代码里最有意思的,是一个看起来有些寒酸的参数:AirPods 上的摄像头只有 100 万像素。在手机已经讨论 2 亿像素、8K 视频的今天,苹果给未来 AI 硬件准备的摄像头,实际采集画面甚至可能只有 320×320。

两种工作状态,左右耳协同「看」

从代码看,这套摄像头至少有两种工作状态:主动模式下采集 640×640 图像,处理后最高输出 1024×1024;被动模式采集 320×320,输出 320×320 或 512×512。

AirPods 摄像头工作模式示意图
系统代码首次揭示了这副耳机怎么「看」

左右两只 AirPods 可以同步获取 RGB 静态图像,通过相同的 Frame ID 对齐两个视角,再按一定频率持续采集,交给 Visual Intelligence 处理。系统同时处理环境语音、周围声音变化、姿态和头部旋转信息;两颗摄像头之间需要标定,摄像头与运动传感器之间也要校准——头部运动过于剧烈或镜头被遮挡时,对应画面会被直接舍弃。代码中甚至出现了「peripheral inference」相关逻辑,可以在设备侧判断画面中是否存在人物。

左右耳摄像头同步采集示意图
双耳画面按 Frame ID 对齐,再交给视觉智能处理

AI 不需要 4800 万像素,只需要上下文

对 AI 来说,很多时候根本不需要高像素照片。模型只需要知道:桌上放着一本书,前面是一家餐厅,手里拿着一瓶饮料,路牌上写着什么。320×320 已经够用。

分辨率降下来,数据量随之减少,图像处理和传输的负担也会下降。对电池只有耳机大小、又需要长时间佩戴的设备来说,功耗和续航是比清晰度更需要考虑的问题。

过去二十年,消费电子里的摄像头主要服务于人——像素、传感器尺寸、动态范围、色彩,最终都指向「得到好看的照片」。但 AI 摄像头首先服务于机器。

苹果不是第一个沿这条路走的公司:今年上市的光帆 AI 全感耳机就把两颗 200 万像素定焦摄像头塞进左右耳机,核心用途是场景 AI 识别,还把 4G eSIM 和 GPS 放进了耳机盒;更早的 Humane AI Pin 也尝试过用摄像头给 AI 补上视觉,但它需要说服人们在胸前额外佩戴一个新设备——而很多人本来就每天戴着 AirPods。苹果不需要重新发明 AI 硬件,只需要让已经存在的硬件长出新感官。

AI 时代的 AirPods 不是耳机,而是传感器

两只 AirPods 已经组成一套传感器组合:摄像头观察眼前有什么,陀螺仪记录头部朝向,麦克风收集周围声音,位置和运动传感器补充人在哪里、正在做什么。

想象一个场景:走进书店,拿起一本书,然后问 Siri「这本讲什么」。单独把这句话交给今天的大模型,它其实什么也不知道;但如果 AirPods 刚刚看到了封面、知道头部正朝向这本书,iPhone 又知道你身处书店,Siri 才真正理解「这本」指什么。如果系统还知道你读过同作者的两本书、一本读完一本只读了三分之一,它甚至可以给出只对你有意义的答案。

今天我们和 AI 交流,一直在不停向它解释自己:我是谁、我在哪、我刚看到了什么、为什么突然问这个问题。很多提示词,本质上都在人工补充机器缺失的上下文。摄像头、麦克风和传感器要做的,就是把这些解释逐渐省掉。

隐私细节与 2027 年布局

代码里还有一个小细节:每只 AirPod 似乎都能控制硬件指示灯的开关和亮度。如果这对应摄像头的工作状态,那么当 AirPods 获取环境图像时,周围的人可能会通过灯光得到提醒——这很符合苹果一贯的隐私策略。

2027 年对苹果本就是特殊的一年:iPhone 二十周年。据目前的爆料,苹果正在准备大幅改变设计的二十周年 iPhone,而摄像头 AirPods、智能眼镜、可以夹在衣服上的 AI 挂饰,乃至带摄像头的 Apple Watch,都可能在同一时期陆续登场。

耳机、眼镜、手表单独拿出来,都不足以真正理解一个人;但它们分别掌握着人的不同切面——手表知道昨晚睡了多久、今天走了多少路,手机知道几点离开公司、去了哪家餐厅,Mac 知道下午打开了哪些文档,AirPods 几乎一直贴着耳朵。AI 出现以后,心率、照片、位置这些原本分散在不同应用里的信息,第一次可以变成同一样东西:上下文。

大模型会变成可以替换的能力,今天用这个,明天可以换另一个;真正难以复制的,是一个人的上下文。这也让苹果反复强调的端侧计算、Secure Enclave 和 Private Cloud Compute 有了另一层意义:真正了解你的 AI,需要处理比照片和聊天记录更私人的信息,而苹果最理想的答案,是让这些信息留在用户自己手里——留在苹果的设备,以及苹果构建的私有计算体系里。