返回

第一百一十七章 平台期

首页
关灯
护眼
字:
上一页 回目录 下一章 进书架
    第一百一十七章 平台期 (第2/2页)

五轮,0.1个点。曲线在快速变平。

    “84.7已经是後训练能做到的极限了,”赵文渊说,“再往上走,就不是加数据加显卡能解决的问题了韩路一看着那条曲线。

    他想起上次开会的时候,赵文渊在会议室投屏上放的同一条S形曲线。当时的状况,准确率还处在Scaling Law的前半段。

    数据点在曲线的极速上升阶段。

    现在数据点走到高原了,大力出奇迹,这招在这不再好使了。

    “也就是说,”韩路一的手点在办公桌上,“我们用开源底座做微调这条路,走到头了。”“不是走到头了,是走到平台了。”赵文渊纠正他,“就像减肥,平台期是可以突破的,但是你得换一种方式才能突破。”

    “什麽方式?”

    赵文渊合上笔记本,从腋下抽出那个本子。韩路一瞄了一眼,牛皮纸封面,上面用黑笔密密麻麻写了一堆英文缩写和箭头,像上学时候的笔记本。

    赵文渊翻到其中一页,把本子摊在茶几上。

    “三条路。”

    他指着第一行。

    “第一条,继续走RLHF,强化学习加人类反馈。”

    RLHF,Reinforcement Learning from Human Feedback,强化学习加人类反馈。简单说,就是让真实用户来当裁判,用户觉得生成得好,模型记住;用户觉得不行,模型改。久而久之,模型就能学会“用户认为好的内容”。

    韩路一没说话,等他往下讲。

    “思路很简单,开物上线这几个月,真实用户的操作数据我们全都留着。用户觉得生成得好的,点了采纳;觉得不行的,手动改了或者重新生成。这些行为本身就是最好的反馈信号。用这些数据训一个奖励模型,然後用强化学习让天工去拟合这个奖励函数。”

    “有别於之前我们基於BugKiller数据的反馈训练,这种训练可以让模型更加理解用户输入所对应的意图,这是超越Bug修复的部分,更偏向於语义理解。”

    “成本呢?”

    “标注基础设施加上奖励模型训练和迭代,大概五百到一千万,时间三到六个月。上限嘛,”赵文渊想了想,“估计能再提三到五个点,到八十八左右。”

    “这个提升不算大。”

    “在这个阶段每一点提升都很艰难,而且这条路的核心优势不在上限。”赵文渊说,“开物的真实用户行为数据,是我们独有的资产。别人花钱也买不到。”

    韩路一点了下头。

    “第二条,”赵文渊翻到下一页,“MoE,混合专家模型。”

    MoE,Miture of Eperts,混合专家模型。不是把一个模型训得什麽都会,而是训一群各有专长的小模型,遇到问题再决定派谁上。像一家公司,与其要求每个员工全能,不如让专业的人做专业的事。“这个主要是架构层面的改变。不改基座,不改训练方法,改调用方式、推理方式。把一个大模型拆成多个专精的子模型一一一个擅长Python、一个擅长前端、一个擅长数据库。推理时根据任务类型自动路由到最合适的专家,同算力下效果更好,应该也能提三到五个点。”赵文渊接着说。

    “成本?”韩路一问道。

    “一千到两千万,架构要重写,模型要重训,时间四到八个月。”赵文渊说,“技术上挑战不算太大,成本主要是要调的模型多。但是需要补人,我们现在的团队在MoE方面没有经验,至少要招两到三个做过类似架构的人。”

    “最後说第三条。”赵文渊又翻了一页,语气中有点儿兴奋一是他作为科学家的兴奋。

    
上一页 回目录 下一章 存书签