专项拉起来以后,我把两个样本都丢进了回声3.0的内测环境。发布页Ltxsdz…℃〇M
3.0还在研发,主打情感分析,本来不是干这个的。但阿哲把声学比对模块接进去了,我顺手用它跑一遍新视频,想看这层到底假到哪一阶。
屏幕左边是受害人录屏里那个,右边是回声拆出来的三层轨迹:声纹层、人脸微表情层、行为节律层。
前两层我熟。第三层是3.0新加的——它不只看你说了什么、脸长什么样,还看你说话时的停顿落在哪、呼吸的间隙多长、眼角和嘴角的牵动跟语音是不是一套节奏。
我点开行为节律那条曲线。
停顿的位置、呼吸的间隙、微表情的起止——三件事卡在同一个节奏上,像被同一根指挥棒带着。真人也会这样,但真人的是松的、会跑偏的;这条曲线太准了,准到不自然。发布页Ltxsdz…℃〇M
行为模式也在里面。我对着屏幕说了一句,像说给陆时听,其实他不在旁边。
我把报告草拟了一段:该伪造体不仅复刻声纹与人脸,还复刻了目标的行为节律(停顿、呼吸、微表情),属全模态层级,非单一声学伪造。
群里,知夏冒了一句:「这个和声临那时候不一样?」
声临。卷五崩掉的那家。
我盯着那两个字想了两秒。
不一样。我回,“声临只克隆声,这个克隆人。”
陆时接得快:「人?」
“对。声临那会儿,拿一段录音就能仿个音,最多骗过声纹验证。这个不一样——它把一个人的说话方式、呼吸、微表情全训进去了。你听到的是他的声,看到的是他的脸,连他卡壳的习惯都像。这不是’像他说话’,是’像他这个人’。”
阿哲补了一句:「行为节律是训出来的,不是拼的。声临做不到这层。」
知夏:「所以是升级版。」
是进化版。我说,“声临是复印,这个是捏人。”
裴砚:「那比声临麻烦。」
麻烦多了。我回。
我往后靠了靠,椅子轻轻响。窗外的光移到显示器边框上,反射出我的半张脸。我盯着那半张脸想——如果有人拿我的公开影像训一个出来,他会怎么说话,怎么停顿,怎么在说到关键处轻轻眯一下眼。
我也会在说到关键处眯眼。陆时说过。
这个念头让我把笔记本合上了一下,又打开。
沈听。陆时的声音从门口来,他端着两杯水,“喝点水。”
我把水接了,没抬眼:“行为模式确认了。”
“嗯。”
声临只克隆声,这个克隆人。我又说了一遍,像给自己记。
他没接话,把另一杯水放我手边,出去了。
我重新看向屏幕。
第一个样本是ch198的声音,第二个是那个十四秒的视频。两个都还只是——一个克隆了声,一个加了脸和微表情,但受害人都留了心,没转钱。
可既然工具长出了脸,就迟早有人用它去骗一个不留心的人。
我把研判草稿的最后一行补上:当前样本均为未遂,但全模态工具已具备实施真实诈骗的能力,需警惕首个真实受害案。
发到群里。
陆时:「收到。我让老周盯着报案库。」
老周:「行,我这边有异常直接拉你。」
我放下笔。
屏幕上的还定格在那一帧,眼角牵着那下不自然的微表情。
进化的假。
它不再满足于像你的声音。它要像你。
而会像你的东西,迟早有人信。