第九十二章 名字想好了吗
第九十二章 名字想好了吗 (第2/3页)
等他继续。
「SFT需要大量的问题丶答案配对。输入是用户的自然语言提示词,输出是可运行的应用代码,这种数据的质量直接决定模型的上限。」
赵文渊身体前倾。
「人工标注一条高质量数据,几十到上百块,十万条就是千万级别的成本,而且标注团队水平参差不齐,做出来的数据你还得反覆清洗。」
「我在鼎盛的时候见过,CodeSafe吃进去的用户数据量很大,但脏,噪声多,他们花了很多人力清洗,效果始终上不去。」
「垃圾进,垃圾出。」韩路一说。
「就是这个意思,数据质量不行,模型再大也是白搭。」赵文渊说完,看着韩路一的眼神带着试探的意味,他在等韩路一出牌。
「数据我有。」
赵文渊没说话,但身体坐直了。他当时就猜测过,BugKiller为什麽这麽强,要麽有黄金数据,要麽有未公开的先进算法,现在看来是前者。
「你的数据哪来的?」他放慢语速,问道,「不会也是偷的吧?」
这话不是玩笑,赵文渊从鼎盛出来的,就是看不惯CodeSafe偷用户代码喂大模型,这是他的底线。
韩路一正色道:「所有的数据都是用户自愿分享的。注册时的相关选项是默认关闭的,用户必须主动选择将检测结果用於产品改进我们才能看到。协议是律师一条一条审过的,我这也有审计报告。」
赵文渊盯着他看。
「我绝不偷数据。」韩路一说。
「好。」赵文渊点了点头,「那数据量够吗?」
韩路一打开背包里的笔记本电脑,接上手机热点,先登录开物後台。
屏幕上跳出一个数据看板。
「开物上线到现在,累计二十三万条提示词—代码配对,」韩路一把屏幕转向赵文渊,「全部来自用户主动分享。」
赵文渊扫了一眼总数:「二十三万条————量是够了。但有个问题,AI生成的代码本身就有Bug,直接拿来训练不还是垃圾进垃圾出?」
「所以有第二步。」
韩路一切换到另一个界面,BugKiller的数据管线看板。
「开物每一条生成的代码,都会自动过一遍BugKiller的检测引擎,有Bug的标出来,能自动修复的直接修复,修不了的丢弃。」
赵文渊凑近屏幕。
数据流很清晰:用户提示词→原始生成代码→BugKiller自动检测→修复後代码→入库。
每一条数据都带着状态标签,「通过」或「已修复」,没有「未修复」。
「原始代码通过率60%上下,经过BugKiller修复後,最终入库率96%。」
赵文渊没说话,他伸手拿过笔记本,开始自己翻数据。
他先看了几条「已修复」的,原始代码里确实有Bug,修复後的代码乾净利落。然後他翻「通过」的那些,原始生成就没问题,代码结构清晰,变量命名规范。
一条丶两条丶五条丶十条。
他逐行看修复逻辑。
二十条丶三十条。
瑞幸店里的音乐换了几首,赵文渊都没有抬头。
翻到五十条左右的时候,他停了。
(本章未完,请点击下一页继续阅读)