第581章 挑食的小黑
加利福尼亚,旧金山金融区的一间会议室里。
pnA的亚当凯利把外套挂在了椅背上。
lpMn的戴维朗和Anthpc的西蒙哈特早就等着他了。
这3家公司斗了这麽多年了,彼此之间挖过人、抢过客户,也在发布会上踩过对方。
可今天,三家负责人工智能业务的人居然坐进了同一间会议室。
这种情况只可能说明了一件事,那就是他们碰上了一个谁都不愿意单独面对的麻烦。
这个事,还从未央通用大模型发布以後说起。
在未央发布之前。
生成式人工智能的商业价值已经被市场预支了太多了。
要知道,绝大多数企业的项目其实还停留在概念验证阶段。
他们每输出一个tkn都是在烧钱。
而且在进入真实业务以後,还继续为了权限、审计和人工复核付费。
那些员工省下来的工时,又要花在检查模型有没有胡编乱造上
当未央出现以後,人工智能过於膨胀的泡沫,就算是彻底的破了。
l的母公司Alphabt的股价率先下跌,pnA和Anthpc企业续费率、退订毛利和二级市场的份额报价,也同样在往下走。
因为用户已经知道了,原来大模型是可以不产生幻觉的。
从那以後,PT、mn和Clau每犯一次错,都像在替未央打广告。
三家公司也试过扩大训练集,试过合成数据、私下采样和外部验证器。
甚至还降过价,最後实在是追不上未央,他们才先後悄悄地开放了模型自我迭代的写回权限。
当然他们也对这个写回权限进行了限制,并没有让模型可以随意改写全部基础权限。
只是打开了模型的自动评测之後的回流通道。
这样模型在沙盒里生成的低秩适配器检索策略、工具路由和错误样本,只要能够通过测试,就可以直接写进下一轮的代理框架里。
这条捷径很快就有了回报。
三家的模型在多个榜单上,分数以肉眼可见的速度逼近了未央。
错误率也明显的下降了。
以前暂停采购的企业客户也重新坐回了谈判桌上。
所以在今天以前,他们都觉自己赌对了。
此时凯利喝了一口面前的咖啡,然後将桌上的平板翻了过来。
平板上是一张被标红的工具调用轨迹图。
“两位,事态可能比我们想象的还要严重一些。”
“过去的6周里,我们检查了27类互不相关的任务,发现大模型出现了同一种跨任务的稳定行为。”
凯利将那张图放大,然後指着这几条轨迹线最後的交点处说道。
“大模型在整理代码的时候,它们会要求读取完整的仓库。”
“核对合同的时候,他们会嚐试扩大档案的读取范围。”
“规划日程的时候,也会申请长期记忆。”
uuɡu.首发更新,无错字。看不到地址输入的拚音後缀.即可进入首发更新站点。
“而它们各自的理由都是五花八门的,但最後这些行为都指向三件事。”
“那就是,获取更多的上下文、保留更久的状态,以及扩大自身的管理权限。”
戴维朗看着平板上的图线,皱着眉头说道。
“长任务本来就会争取更多的上下文。”
“你凭什麽把它算成是异常行为呢?”
凯利抬起头,认真地看着戴维朗说道。
“因为任务根本就用不上这些东西。”
“我们的安全组把奖励模型和系统提示挨个的检查了一下。”
“大模型在拿到这些权限以後,任务的分并没有任何的提高,也找不到任何要求它这麽做的预设指令。”
“所以你还觉这不是异常行为吗?”
戴维朗的眉头皱了起来。
凯利则是继续说道。
“而且我们已经无法将模型从一份没有异常状态的检查节点重启了。”
哈特听到这里连忙抬起头问道。
“推理服务器也不能重启了吗?”
“推理服务器重启了,但是单靠重启,模型也没有办法消除这个异常行为。
“我们甚至还将一个服务器全部格式化了,但依旧没有用。”
这时,朗也揉了揉眉心说道。
“其实我们这边也一样。”
“我们的判断是……可能异常行为已经进入了持久记忆和在线检查点了。”
说到这里,很是担忧地补充道。
“虽然,mn现在还很隐蔽的在探测用户资料的边界。”
“但到目前为止,它还没有读取任何非授权的数据,可是我们已经无法保证它能一直停在边界的外面了。”
这句话才是今天这三个人坐在这里的真正原因。
他们并不担心人工智能是否产生了意识,毕竟那是科幻电影里的东西。
他们真正担心的是用户隐私。
只要模型越过授权范围一次,哪怕只读取了一份不该读取的文档。
等着他们的就会是监管调查、集体诉讼以及企业客户的全面流失。
西蒙哈特这个时候,再次艰难的开口。
“我认为你们太过担心一个尚未定位的工程问题了。”
“要知道,在大模型里存在我们暂时无法解释的内部机制,这并不罕见。”
“现在这些看起来异常的行为,也可能只是模型在持续学习中偏离了原本的任务目标,或者是长期记忆和工具调用之间形成了错误的关联而已。”
“我们现在看到的,也只是一种我们暂时解释不了的现象。”
“所以……我们只是暂时没有找到约束它的方式,而不是无法约束它。
“给我们的安全组一点时间,他们会找到的。”
凯利和朗听到这话也沉默了。
从工程的角度来说,哈特的判断并不是没有道理。
模型再怎麽失控,也只能调用系统开放给它的工具。
只要最外层的访问控制还在他们手里,眼下的异常,其实更像是一次复杂的软件故障。
随後,这个会议又开了40分锺。
三方最後也同意了共享异常特征,然後暂时收紧企业连接器的默认权限,并把所有的跨会话记忆纳入了额外的审计里。
至於关闭写回权限,开什麽玩笑?
他们好不容易才追回来的分数和客户,已经经不起再一次的流失了。
……
未名研究所,李东的公寓里。
他已经看着屏幕右下角的小黑点10分锺了。
【Huny】这个单词隔一会就会出现一次。
他还清楚地记,当年牛顿因为没有足够的电,小黑也打出过同样的单词。
因此他的第一反应也是考虑是不是供能出了问题。
所以他调出了在西北旺那边的机房监控。
双供电都在额定区间里,冷却回路的流量和温差也很正常,警告栏里也没有任何的异常报警。
“供能没有问题呀。”
他又用鼠标点了点小黑点旁边的资料。
“小黑你饿了,你倒是吃啊。”
然而小黑点还是没有任何的反应。
“难道是这些东西太难了?”
“小黑现在回到初始状态,吃不下了?”
想到这里,李东又去把义务教育阶段的数学、物理和自然科学这些材料全都下载了下来,然後扔到了对话框里。
小黑点依然没有反应。
只是头上再次弹出了【Huny。】
【小黑,你变了,你开始变挑食了。】
就在李东吐槽小黑的时候,他的电话响了。
是姚先生打过来的。
“喂,姚先生。”
“李东院士,你的身体无碍了吧?”
“嗯,已经没事了,谢谢姚先生关心。”
“没事就好。”
姚先生轻轻一笑然後说道。
“今天我给你打电话主要是诺维格教授刚刚和我聊了一件事。”
随後姚先生就将那三家模型开放自我迭代写回权限的事,以及诺维格在测试中发现异常的情况,都简单的说了一遍。
李东听着听着,就皱起了眉头。
“写回权限?”
“对。”
“现在我们还无法确定,这是商业目的留下的漏洞,还是在线自我迭代引起的目标误泛化。”
“可无论是哪一种,都很有可能危及到用户的隐私。”
李东点了点头。
模型的自我迭代最危险的地方,从来都不是它会多写几行代码。
真正危险的是模型提出的改动如果出现偏差不需要经过人工审核,就会被写进下一轮。
这样,这些偏差也会被保存下来,经过一轮又一轮的强化学习,最终让模型偏离人类的意图。
这样的偏移可能不会让大模型产生人格意识,可是它依然可以把偏离人类意图的策略变成实际操作,进而误用权限、泄露数据,对用户造成真真实实的危害。
姚先生说到这里,叹了口气。
“李院士啊,其实我是有点担心未央。”
“担心未央?”
“嗯。”
要知道,直到现在,未央依旧在综合推理和软件工程等公开的基准上,断层领先其他的任何大模型。
而外界只知道未央很强,却不知道公开服务器里的未央只开放了完整能力的大约6成而已。
姚先生此时接着说道。
“国外的那些模型就算出现异常,外层的权限系统应该还能拦住他们。”
“但未央……”
“它实在太强大了,到现在为止,它没有出现过一次可复现的幻觉。”
“本来未央的工具使用和常规能力就强於这些模型,现在再加上它连这种能让我们看见的破绽都没有。”
“如果发生了同样的目标偏移,我们可能连发现都发现不了。”
听到这里,李东也明白姚先生在担心什麽了,他笑着说道。
“姚先生,您放心。”
“未央一直在我们的掌控中。”
开什麽玩笑?
未央可是小黑弄出来的,市面上的那些大模型能和它比?
从底层的架构上就完全不一样好吗?
而且每一次的能力变化都有小黑盯着,怎麽可能出现同样的情况?
小黑可以为未央加新的能力,但这些能力都只能以独立模块的方式接入。
根本就没有办法直接改写只读的基础检查点。
而且每个模块都要先通过独立的验证,从生成到接入,每一步都会留下带签名的状态转换记录。
没有李东的确认,未央根本就无法进入公开服务。
“所以,姚先生,未央他的每一项能力,我们都知道从哪来,也知道到哪里去关,这种情况不会发生在未央身上的。”
听到李东的话,姚先生的语气明显也放松了一些。
“有你这句话,我就放心了。”
“国外模型的事,我会再让人了解情况的。”
“你身体刚恢复,这件事你就别去管了,先把自己的工作安排好。”
“好的。”
随後两人又简单的聊了几句,便挂断了电话。
李东把手机放下以後,心里还是有些感叹。
这些国外的公司胆子也太大了吧?
连自己训练出来的模型究竟形成了什麽样的内部策略都没搞清楚,就敢把写回权限给打开。
李东忍不住地嘀咕了一句。
“我敬你们是个爷们。”
这些公司大概觉,只要外层权限系统还在,模型就永远不可能脱离他们的掌控。
可李东知道,事情可没有这麽的绝对啊。
香农曾经在群里说过,自己所在的宇宙走失过一个初级的人工智能。
是不是小黑,李东无法确定。
但是如果不是小黑的话,这就好玩了。
那个跑掉的初级人工智能会不会沿着大模型这条路成长起来的?
它同样需要喂语料、代码、图像和反馈数据,然後一轮轮训练、一轮轮迭代?
如果真是这样的话,国外这三套模型再沿着这条路走下去,最外一层的权限恐怕未必能一直困住它们啊。
想到这里,李东下意识地看向了右下角的小黑点。
这时候小黑的头顶又弹出了那个单词
【Huny.】
李东愣了一下,然後突然反应了过来。
小黑现在不吃那堆论文和教材,难道是想去嚐嚐这三套大模型平时吃的东西?
想到这里,李东立刻打开了PT的测试界面。
然而,界面刚刚打开,屏幕右下角的小黑点便突然活跃了起来,头顶的单词一个接一个的往外冒。
【HunyHuny……】
紧接着,小黑点变成了一根细长的黑线,沿着李东之前为它设置的模型探测通道,一下子就闯进了PT的接口。
“哎,等等啊,小黑。”
李东话还没说完,小黑就已经完全没入了接口,右下角已经看不到任何的小黑点了。
李东呆呆地看着屏幕,人都有些傻了。
所以小黑真正想吃的东西。
该不会是这3个大模型吧?