第三百零六章 对接
第三百零六章 对接 (第2/3页)
。前提是你方提供用户关系数据的接口规范。"
寸头工程师开口:"接口可以给,但排序算法核心逻辑必须跑在腾信服务器上,千度只提供模型文件。用户数据不能出腾信机房。"
炜杰点头:"合理,接受。"
会议室的门被推开,马化斌走进来。他穿深灰色西装,没打领带,手里拿着牛皮纸文件夹。
"继续,不用站起来。"他在尽头位置坐下,"我听着。"
陈琳继续:"第四个模块,响应时间。"
马化斌直接问炜杰:"两百毫秒,能做到吗?"
"能。"炜杰说,"千度现在平均一百二十毫秒。定制引擎加一层社交排序,多花五十到八十毫秒,总体控制在一百八十毫秒以内,留百分之十余量。"
"怎么保证?"
"三层缓存。"炜杰打开后台监控界面,"第一层热查询缓存,覆盖四成请求,直接命中不经过分词。第二层分词结果缓存,同一查询词第二次不需要重新切分。第三层索引缓存,最常用的索引块常驻内存。三层叠加,九成请求不碰磁盘。"
马化斌身体前倾:"通用搜索能做到这个速度,定制引擎凭什么保证?"
"定制引擎跟通用搜索共享核心模块,区别只在排序层和映射层。代码写得够紧凑,速度不会有明显损失。"
"够紧凑是什么意思?"
"意思是我会亲自审每一行代码。"炜杰合上笔记本,"三个月交付,不是只交付一个能跑的系统,是交付一个跟千度通用搜索同样快的系统。"
马化斌盯着他看了两秒,转向陈琳:"继续。"
需求评审持续两个小时。双方逐条确认功能清单、交付节点、验收标准,有争议当场讨论,达不成一致的标红留待后续。
十一点三十分,马化斌起身:"我还有个会。中午一起吃饭,就我们两个。"
北京,千度办公室。
老周坐在小会议室里,对面是一个三十岁出头的年轻人,穿格子衬衫,背着洗得发白的帆布包。
"周牧野?"老周看着简历,"中科院计算所,论文方向统计语言模型,导师黄铁军。"
"对。"
"黄铁军我知道,跟北大争了二十年规则派和统计派哪个好。你是统计派出身,千度是混合架构,你能适应吗?"
周牧野取出笔记本电脑打开屏幕:"我看过千度的公开论文,也下载过分词演示工具。混合架构的问题在于规则层和统计层的权重分配——规则太强,新词识别差;统计太强,歧义处理差。我用动态权重调整替代固定权重,测试集准确率提升两个点。"
他把屏幕转向老周。红蓝两条柱状图,差距清晰可见。
老周眼睛亮了一下,但很快恢复平静:"数据好看,实际落地呢?动态权重需要实时计算,服务器压力大不大?"
"有压力但可控。高频词权重走缓存,低频词走固定规则,只有中频词实时计算,占总查询量百分之十五。"
老周沉默片刻。这个年轻人有真本事,思路清晰数据扎实。但老周注意到一个细节——他说"下载过分词演示工具"。那个工具是内部测试版,虽然挂在网上但没推广,外人一般不知道。
"你怎么找到那个演示工具的?"老周问。
周牧野顿了一下:"搜乎技术社区的论坛链接,有人贴了讨论帖。"
老周的手指在桌面停住。这个候选人技术过硬,但跟搜乎有接触。招进来需要多留一个心眼。
"你先回去,等通知。"
深圳,腾信总部楼下的餐厅
(本章未完,请点击下一页继续阅读)