开源大模型DBRX:1320亿参数,比Llama2-70B快1倍

开源大模型DBRX:1320亿参数,比Llama2-70B快1倍

    正在检查是否收录...
一言准备中...

大数据公司Databricks最近发布了一款名为DBRX的MoE大模型,引发了开源社区的热议。DBRX在基准测试中击败了Grok-1、Mixtral等开源模型,成为了新的开源之王。这款模型的总参数量达到了1320亿,但每次激活只有360亿参数,并且其生成速度比Llama2-70B快1倍。

DBRX是由16个专家模型组成,每次推理有4个专家处于激活状态,上下文长度为32K。为了训练DBRX,Databricks团队从云厂商那里租用了3072个H100,历时两个月进行训练。经过内部讨论,团队决定采用课程学习的方法,用高质量数据提高DBRX在特定任务上的能力。这一决策取得了成功,DBRX在语言理解、编程、数学和逻辑等方面均达到了SOTA水平,并在大多数基准测试中击败了GPT-3.5。

Databricks还发布了DBRX的两个版本:DBRX Base和DBRX Instruct,前者是预训练基础模型,后者则经过指令微调。首席科学家Jonathan Frankle透露团队接下来计划对模型进行进一步研究,探索DBRX如何在训练的“最后一周”中获得额外技能。

尽管DBRX受到开源社区的欢迎,但也有人对其“开源”的质疑。根据Databricks公布的协议,基于DBRX打造的产品,如果月活超过7亿,就必须另行向Databricks提交申请。

项目入口:https://top.aibase.com/tool/dbrx

databricks大数据大模型gpt高质量gpt-3语言理解上下文开源模型llama科学家预训练基础模型生成速度llama2gpt-3.5
  • 本文作者:WAP站长网
  • 本文链接: https://wapzz.net/post-12002.html
  • 版权声明:本博客所有文章除特别声明外,均默认采用 CC BY-NC-SA 4.0 许可协议。
本站部分内容来源于网络转载,仅供学习交流使用。如涉及版权问题,请及时联系我们,我们将第一时间处理。
文章很赞!支持一下吧 还没有人为TA充电
为TA充电
还没有人为TA充电
0
  • 支付宝打赏
    支付宝扫一扫
  • 微信打赏
    微信扫一扫
感谢支持
文章很赞!支持一下吧
关于作者
2.7W+
9
1
2
WAP站长官方

Whisper-AT:一个统一语音识别和音频标签的模型

上一篇

如何利用物流人工智能实现智能运输

下一篇
  • 复制图片
按住ctrl可打开默认菜单