第13章 空手套白狼
人道大圣小说推荐阅读:娇软美人在末世封神了、世界末日之毒液、大佬的小人鱼揣崽跑路了、特案三组、腐烂国度之活下去、末日聚集地、一价氢氯钾钠银、御鬼者传奇、暗影熊提伯斯的位面之旅、这个文字冒险游戏绝对有毒、末世满级大佬有异能空间、从黑科技到超级工程、快穿之养老攻略
如果是匿名的话,这笔生意好像有搞头啊。
无论是继续在DeepMind,还是去推特,这都会是自己的资粮。
在谷歌,摸一摸首席人工智能专家也不是梦。
去推特,自己要掏多少钱给这个华国年轻人,那马斯克给自己开的薪水包起码翻倍。
怎么想都不亏。
“成交,我会喊人去做小规模验证的。”巴布什金说道。
陈曦说:“成交。”
为什么要自己来?
为什么要有卡?
空手套白狼不好吗?
......
伊戈尔·巴布什金先是把文档再重新好好看了一遍。
然后接着把里面一些措辞进行了修改,数据的格式也做了修改,改成更符合自己习惯的命名方式。
然后才把小实验要用到的东西,通过自己的私人邮箱发给自己的心腹。
他给陈曦留的也是私人邮箱,不是谷歌的工作邮箱。
尼克·沃尔什,他招来的手下,在团队里存在感不强,长着一张看上去就睡眠不足的脸,习惯穿着旧卫衣在办公室溜达。
有能力又忠诚,如果自己要去推特,伊戈尔·巴布什金第一个带的就是尼克。
“尼克,我发了个邮件给你,你看看,先做个实验,隔离做,不进主仓库,也不用项目名称,你可以把这看成是我的私活。”
尼克接到电话的时候,正在家里的餐桌旁吃昨天晚上派对带回来的披萨。
听到后,他丝毫没有感到意外。
在他看来,伊戈尔老是这样,冷不丁地丢来一段想法,让他做个验证,或者干个别的事情。
他们的团队每周都会冒出很多有价值的想法,只是最后能落地的少之又少。
因此他回了个:“好的,巴布什金先生。”
话音落下,那边挂断了电话,他继续吃披萨。
吃完才把Mac搬到餐桌上,打开电脑,打开邮箱,打开文档。
“...候选程序数量、可见测试通过率和策略覆盖度是三件不同的事。模型可以通过大规模采样制造出数量上的繁荣,却仍然在少数失败族里打转...”
这是直指AlphaCode的漏洞啊,尼克思忖。
他继续往下看,数据格式写得很具体。
每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。
尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。
他开始按文档搭最小验证环境。
伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动AlphaCode主流程,只用公开题目和小规模候选程序集。
伊戈尔之所以会这样选,是因为他不想被谷歌发现。
他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。
尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。
一开始他还有点不耐烦,因为这东西过于手工。
指标漂亮当然是好事。
但前提是,漂亮的指标得是模型自发生成的。
而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。
为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。
就是因为针对测试的指标,进行的人工修剪成分过多了。
来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。
如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。
第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。
按照常规方法看,模型给出了不少不同方案。
一旦用反例探针重新测试,候选程序开始成片成片倒下。
变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。
尼克盯着结果,又跑了一遍。
结果差不多。
他开始兴奋起来。
隐隐约约的感觉被程序给证实。
原本模糊的现象突然被测出来了。
团队里很多人都知道大规模采样会制造虚假的多样性,也知道候选程序之间存在同质化。
知道是一回事,能把它测出来是另一回事。
他接着按照文档里的方法训练了一个很小的策略判别器。
模型粗糙,数据不大。
它不能和AlphaCode相提并论,更谈不上对外发布。
但在这批小样本上,它已经能比语法聚类更稳定地把看起来不同、实则同源的候选程序归到一起。
当他把反例生成器加入筛选流程后,最终留下的候选解法数量少了,策略互补性明显变高。
他把结果导出成表格,又跑了三组不同随机种子。
提升幅度有波动,趋势没有消失。
语法多样性和策略多样性之间的差距,被这个小实验找到了命门。
哪怕已经到了深夜,尼克也忍不住要给巴布什金打个电话。
电话接通后,巴布什金没有寒暄:“结果怎样?”
尼克说:“结果很惊艳,我隐约觉得它找到了那条路,老板,你做到了!”
能从尼克语气里听到兴奋,显然这个小的验证效果好到出乎伊戈尔·巴布什金的预料。
他没有回答,在思考。
尼克见电话那头没有回复,于是继续说道:“在小规模验证里,这套东西确实测出了普通聚类测不到的策略坍缩。反例探针对候选程序的杀伤不是随机的。测试方案里语义有效样本量指标很有效。”
“而且,加入策略判别器之后,留下来的候选解法更接近真正不同的思路,他们之间有时候甚至能形成隐形的互补。”
伊戈尔·巴布什金说:“好,我知道了。”
说完,他挂断了电话。
伊戈尔·巴布什金陷入了两难的境地。
如果做模型的正式训练,那么无论是算力的使用还是日志记录、数据流,都没办法瞒过DeepMind和背后的谷歌。
风险会大到爆炸。
最后只能老老实实上报给谷歌的董事会。
另外一条路就是找马斯克,用推特的卡来训练。
但这同样有问题,那就没办法待价而沽了,只能拿来和马斯克抬价了,自己回不去谷歌了。
谷歌还是推特?这是一个问题。
http://www.rendaodashegn.com/yt134878/50175332.html
请记住本书首发域名:www.rendaodashegn.com。人道大圣手机版阅读网址:www.rendaodashegn.com
无论是继续在DeepMind,还是去推特,这都会是自己的资粮。
在谷歌,摸一摸首席人工智能专家也不是梦。
去推特,自己要掏多少钱给这个华国年轻人,那马斯克给自己开的薪水包起码翻倍。
怎么想都不亏。
“成交,我会喊人去做小规模验证的。”巴布什金说道。
陈曦说:“成交。”
为什么要自己来?
为什么要有卡?
空手套白狼不好吗?
......
伊戈尔·巴布什金先是把文档再重新好好看了一遍。
然后接着把里面一些措辞进行了修改,数据的格式也做了修改,改成更符合自己习惯的命名方式。
然后才把小实验要用到的东西,通过自己的私人邮箱发给自己的心腹。
他给陈曦留的也是私人邮箱,不是谷歌的工作邮箱。
尼克·沃尔什,他招来的手下,在团队里存在感不强,长着一张看上去就睡眠不足的脸,习惯穿着旧卫衣在办公室溜达。
有能力又忠诚,如果自己要去推特,伊戈尔·巴布什金第一个带的就是尼克。
“尼克,我发了个邮件给你,你看看,先做个实验,隔离做,不进主仓库,也不用项目名称,你可以把这看成是我的私活。”
尼克接到电话的时候,正在家里的餐桌旁吃昨天晚上派对带回来的披萨。
听到后,他丝毫没有感到意外。
在他看来,伊戈尔老是这样,冷不丁地丢来一段想法,让他做个验证,或者干个别的事情。
他们的团队每周都会冒出很多有价值的想法,只是最后能落地的少之又少。
因此他回了个:“好的,巴布什金先生。”
话音落下,那边挂断了电话,他继续吃披萨。
吃完才把Mac搬到餐桌上,打开电脑,打开邮箱,打开文档。
“...候选程序数量、可见测试通过率和策略覆盖度是三件不同的事。模型可以通过大规模采样制造出数量上的繁荣,却仍然在少数失败族里打转...”
这是直指AlphaCode的漏洞啊,尼克思忖。
他继续往下看,数据格式写得很具体。
每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。
尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。
他开始按文档搭最小验证环境。
伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动AlphaCode主流程,只用公开题目和小规模候选程序集。
伊戈尔之所以会这样选,是因为他不想被谷歌发现。
他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。
尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。
一开始他还有点不耐烦,因为这东西过于手工。
指标漂亮当然是好事。
但前提是,漂亮的指标得是模型自发生成的。
而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。
为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。
就是因为针对测试的指标,进行的人工修剪成分过多了。
来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。
如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。
第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。
按照常规方法看,模型给出了不少不同方案。
一旦用反例探针重新测试,候选程序开始成片成片倒下。
变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。
尼克盯着结果,又跑了一遍。
结果差不多。
他开始兴奋起来。
隐隐约约的感觉被程序给证实。
原本模糊的现象突然被测出来了。
团队里很多人都知道大规模采样会制造虚假的多样性,也知道候选程序之间存在同质化。
知道是一回事,能把它测出来是另一回事。
他接着按照文档里的方法训练了一个很小的策略判别器。
模型粗糙,数据不大。
它不能和AlphaCode相提并论,更谈不上对外发布。
但在这批小样本上,它已经能比语法聚类更稳定地把看起来不同、实则同源的候选程序归到一起。
当他把反例生成器加入筛选流程后,最终留下的候选解法数量少了,策略互补性明显变高。
他把结果导出成表格,又跑了三组不同随机种子。
提升幅度有波动,趋势没有消失。
语法多样性和策略多样性之间的差距,被这个小实验找到了命门。
哪怕已经到了深夜,尼克也忍不住要给巴布什金打个电话。
电话接通后,巴布什金没有寒暄:“结果怎样?”
尼克说:“结果很惊艳,我隐约觉得它找到了那条路,老板,你做到了!”
能从尼克语气里听到兴奋,显然这个小的验证效果好到出乎伊戈尔·巴布什金的预料。
他没有回答,在思考。
尼克见电话那头没有回复,于是继续说道:“在小规模验证里,这套东西确实测出了普通聚类测不到的策略坍缩。反例探针对候选程序的杀伤不是随机的。测试方案里语义有效样本量指标很有效。”
“而且,加入策略判别器之后,留下来的候选解法更接近真正不同的思路,他们之间有时候甚至能形成隐形的互补。”
伊戈尔·巴布什金说:“好,我知道了。”
说完,他挂断了电话。
伊戈尔·巴布什金陷入了两难的境地。
如果做模型的正式训练,那么无论是算力的使用还是日志记录、数据流,都没办法瞒过DeepMind和背后的谷歌。
风险会大到爆炸。
最后只能老老实实上报给谷歌的董事会。
另外一条路就是找马斯克,用推特的卡来训练。
但这同样有问题,那就没办法待价而沽了,只能拿来和马斯克抬价了,自己回不去谷歌了。
谷歌还是推特?这是一个问题。
http://www.rendaodashegn.com/yt134878/50175332.html
请记住本书首发域名:www.rendaodashegn.com。人道大圣手机版阅读网址:www.rendaodashegn.com