第13章 空手套白狼 (第2/3页)
的漏洞啊,尼克思忖。
他继续往下看,数据格式写得很具体。
每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。
尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。
他开始按文档搭最小验证环境。
伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动AlphaCode主流程,只用公开题目和小规模候选程序集。
伊戈尔之所以会这样选,是因为他不想被谷歌发现。
他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。
尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。
一开始他还有点不耐烦,因为这东西过于手工。
指标漂亮当然是好事。
但前提是,漂亮的指标得是模型自发生成的。
而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。
为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。
就是因为针对测试的指标,进行的人工修剪成分过多了。
来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。
如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。
第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。
按照常规方法看,模型给出了不少不同方案。
一旦用反例探针重新测试,候选程序开始成片成片倒下。
变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。
尼克盯着结果,又跑了一遍。
结果差不多。
他开始兴奋起来。
隐隐约约的感觉被程序给证实。
原本模糊的现象突然被测出来了。
团队里很多人都知道大规模采样会制造虚假
(本章未完,请点击下一页继续阅读)
『加入书签,方便阅读』