第187章 提出全新架构(1 / 1)

2039年12月,北京,西山。她花了整整三个月,把Transformer架构从自然语言处理领域搬到了战场决策系统里。王浩一开始觉得她疯了,因为从来没人这么干过。林小镜说“没人干过,我来干”。她把论文打印出来放在桌上,不是一篇,是二十篇。每一篇都用红笔划了重点,旁边写着批注。她的字很小,但很清楚,一笔一划,从不连笔。王浩看了那叠论文,又看了她一眼,什么都没说。他知道,林小琴不是那种随便翻翻就下结论的人,她看过的每一页都记得住,推导过的每一步都不会忘。她让他做的时候,基本上已经是对的了。

她提出的架构和原来的卷积神经网络完全不同。卷积神经网络像过滤器,一层一层地筛选特征,边缘、形状、物体,逐层抽象。但战场上的情况不是静态的,敌人会动,战术会变,局势会演化。卷积神经网络处理不了时间序列,它没有记忆。Transformer不一样,它是基于注意力机制的,可以关注到战场上的每一个关键点,还能记住过去的信息。敌机从哪个方向来,之前出现过什么动作,系统都可以结合这些判断下一步怎么反应。不是条件反射,是真的在思考。不是规则,是涌现出来的策略。有些连设计者自己都没想到。

训练数据是军方提供的,过去十年的演习记录和真实作战数据。几百个TB,装了满满一硬盘柜。林小镜花了三周时间清洗数据,把噪声滤波,把异常值剔除,把格式统一。她把数据切成几百万个片段,每个片段几秒钟。输入是雷达信号、红外图像、电子对抗参数,输出是决策指令。开火、规避、追踪、释放干扰,每一个决策都有时间戳。她把这些数据送进模型,让它自己学。不是“教”它是规则,是“喂”它数据,让它自己找规律。规律不是人定的,是数据里长出来的,可能对,也可能错。错了就改,对了就保留。她从来不假设自己是对的,她只相信数据验证过的结论。

第一次训练跑了整整一周。七台服务器同时运行,GPU满载运转,风扇的声音像飞机起飞。林小镜每天去看日志,看准确率,看损失函数。第一轮过拟合了,准确率很高,但泛化能力很差。换个场景就不行了。她一看就知道,数据量还是不够。陈处长又调来了过去二十年的演习记录,加上北约的公开数据集和模拟仿真生成的合成数据。数据量翻了三倍。第二次训练跑了十天,准确率从百分之七十五升到百分之九十一,泛化能力也好了很多。在仿真测试中,系统面对从未见过的场景,正确决策率达到百分之八十五。王浩看着结果说“可以了”。林小镜说“还不够”。她加了对抗训练,自己生成攻击样本,让系统自己打自己,逼它找出自己的弱点。弱点找到,补上。再找,再补。

第三轮训练,准确率上了百分之九十五,泛化能力接近百分之九十。陈处长来看演示,屏幕上模拟了一场空战。红方是AI控制的战斗机,蓝方是传统的规则系统。红方规避、佯攻、包抄、锁定、开火,整个过程像经验丰富的老飞行员,甚至更果断。蓝方被打得毫无还手之力。陈处长沉默了很久,看着屏幕上定格的画面——红方锁定蓝方的那一格,问了林小镜一句话:“这个系统,能不能装在无人机上?”林小镜说“能”。陈处长又想了很久,才说“我回去汇报”。他走了,脚步声在走廊里渐渐消失。林小镜站在屏幕前,看着红方锁定蓝方的那个画面。她没觉得骄傲,只是觉得这条路走对了。走对了就继续走,走错了就拐弯。她不怕拐弯,只怕停在原地。

晚上,王浩收拾东西准备回招待所。他站在门口,回头看她还坐在电脑前。“你还不走?”林小镜头也没抬,说“我再看看数据”。王浩看了她一会儿。她的白头发在屏幕的光下反着光,银白色的,很亮。眼睛里映着代码和数字,红棕色的瞳孔像一块琥珀。她瘦了,但没瘦多少,本来就不胖。王浩想说点什么,但没说出来,转身走了。走廊里响起他的脚步声,一下一下的,越来越轻,然后消失。林小镜没听到关门声,她在看数据,有一条曲线走势不太对,她要找出原因。不是急,是不能放。问题不解决,睡觉都睡不安稳。

她找到了。数据增量的步长设错了,大了零点零一。改过来,重新跑。等结果的时候,她靠在椅背上,闭上眼睛。她想起了刘远,想起了他说过的一句话:“你会走得很远。”她现在算是走得远了吧,但她觉得还不够远。她想走到问题尽头。问题有尽头吗,她不知道。不知道就继续走,走一步算一步。她睁开眼睛,结果出来了,曲线平稳了。没有波动,没有异常。她关掉电脑,站起来,走向门口。办公室不大,她走了五步就到了。她关灯,锁门。走廊里很安静,只有她的脚步声,一声一声,在空荡的空间里回响。电梯门开了,她走进去,数字从5跳到1,叮的一声,门开了。她走出大楼,山风很冷,吹在脸上像针扎。她把外套拉链拉到最上面,缩了缩脖子,快步走向停车场。车在等她,她坐进去,关上车门,挡住了外面的风。