一张「已验证」的照片到底证明了什么
Apple Reference Image 证明的是「有相机看见过」,C2PA 证明的是「编辑历史」。这是两个不同的主张,失效方式也不同,而且都不回答人们以为它们回答的那个问题。

一张「已验证」的照片到底证明了什么 📷
Apple 这个月公布了 Apple Reference Image:在 iPhone 18 Pro 和 Pro Max 上,相机可以把一张照片存两次 —— 一次是正常的可编辑照片,一次是带着标识的参考图像,用来证明这些光子来自真实传感器而不是模型。Apple 把第二个文件称为数字底片。
值得注意的是,Apple 没有采用 Nikon、Canon 和 Google Pixel 已经支持的 C2PA Content Credentials。Apple 给出的理由是结构性的:C2PA 是在拍摄之后附加来源信息,再从那一刻起为编辑链背书 —— 而这条链在任何一环都可能被攻破。
我们是靠做合成人类吃饭的,所以在这件事上有点特别的利害关系。把两种方案各自证明了什么说清楚是值得的,因为麻烦恰恰藏在"它证明了什么"和"人们以为它证明了什么"之间的那段距离里。
两个不同的主张
参考图像是关于来源的主张。 它说:某台这种型号设备里的传感器捕获了这些光子,这里有一个没有那个传感器就很难伪造的值。它对之后发生了什么只字未提,因为它根本不在编辑链路上 —— 它是拍摄瞬间被封存到一边的副本。
内容凭证是关于历史的主张。 它说:这个文件源自某处,然后经过了这些操作,每一步都为自己的工作签了名。它是一条链,而任何链都只和最弱的那个签名者一样强。
这两者解决的是相邻的问题,而且很容易说岔。"这张照片是真的吗"由前者回答;"这张照片拍的真是它声称的东西吗"两者都不回答。
失效方式并不对称
链是渐进且无声地失效的。每个碰过这个文件的工具都必须参与。不参与的那个会把凭证剥掉,而被剥掉的凭证和从来没有过凭证是无法区分的。实际上,绝大多数图片在经过一次截图、一次即时通讯、一次重编码,或者在一个不感知凭证的编辑器里裁剪之后,到达时什么都不带。没有来源信息才是常态,这就使得"没有来源信息"这件事本身不含任何信息。
底片是在边界上失效的。它是一个强主张,但范围很窄,弱点也正是任何锚定在硬件上的东西该有的那些:只有那个硬件在的地方才有它;它对流传出去的那张照片什么也没说(只说了封存的那份);而且需要有人真的去把两者比对一次。验证这一步是独立动作,而绝大多数看图的人永远不会做。
两者都值得有。两者都不是检测器。
任何来源系统都碰不到的那个问题
拿一台已验证的相机,对着一块显示生成图像的高质量屏幕拍。
传感器确实看见了光子。证明确实有效。得到的文件,按这套系统能施加的每一项技术度量,都是一张真照片 —— 拍的是一张假图。这是模拟漏洞,这个说法有几十年历史了,而且在拍摄边界上加多少密码学都堵不上,因为系统证明的是"拍摄发生了",而拍摄确实发生了。
这也是整个门类最诚实的总结:来源证明确立的是文件从哪来,不是它的内容是否为真。 这两件事从来就不是同一个问题。一张照片一直都可以在不改动任何一个像素的前提下,在语境、取景和时间上说谎。
这对合成媒体意味着什么
这里是我们自己的利害所在,与其说得让人安心,不如说明白。
如果你在做能产出以假乱真的合成人类的系统 —— 我们就在做 —— 那么正确的姿态不是主张"检测技术会跟上"。它不会可靠地跟上,而一个依赖检测器持续领先的产品是建在沙上的。持久的答案,正是这些来源系统从另一头伸手去够的那个:让来源标识成为结构性的,而不是取证性的。
具体说,就是标识随交互一起走,而不是从交互里推断出来。一个合成参与者应当由运行它的系统在任何时候标明其为合成 —— 作为会话的属性,而不是一个需要有人去找的水印。"这是 AI"这件事不该靠检测得知,它该由平台声明,因为平台就是知道的那一方。
从一个意义上说这是更弱的保证 —— 它只在选择执行它的系统内部成立;而在实践中它强得多,因为它不要求观看者去跑一个他们永远不会跑的检查。
Apple 的底片和 C2PA 的链条,都是想把真实性从取证的行当搬进结构的行当。它们之间的分歧是"锚点放在哪里",这是个真实的、值得关注的分歧。要抵抗的是另一个结论 —— 以为有了其中任何一个,你就能看一眼图片然后知道。