返回第13章 空手套白狼  法师归来,速通地球!首页

关灯 护眼     字体:

上一页 目录 下一页

    第13章 空手套白狼 (第2/3页)

的漏洞啊,尼克思忖。

    他继续往下看,数据格式写得很具体。

    每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。

    尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。

    他开始按文档搭最小验证环境。

    伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动AlphaCode主流程,只用公开题目和小规模候选程序集。

    伊戈尔之所以会这样选,是因为他不想被谷歌发现。

    他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。

    尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。

    一开始他还有点不耐烦,因为这东西过于手工。

    指标漂亮当然是好事。

    但前提是,漂亮的指标得是模型自发生成的。

    而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。

    为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。

    就是因为针对测试的指标,进行的人工修剪成分过多了。

    来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。

    如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。

    第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。

    按照常规方法看,模型给出了不少不同方案。

    一旦用反例探针重新测试,候选程序开始成片成片倒下。

    变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。

    尼克盯着结果,又跑了一遍。

    结果差不多。

    他开始兴奋起来。

    隐隐约约的感觉被程序给证实。

    原本模糊的现象突然被测出来了。

    团队里很多人都知道大规模采样会制造虚假

    (本章未完,请点击下一页继续阅读)

『加入书签,方便阅读』

上一页 目录 下一页