新闻中心
发布几小时,微软秒删媲美GPT-4开源大模型!竟因忘记投毒测试
上周,微软空降了一个堪称GPT-4级别的开源模型WizardLM-2。
却没想到发布几小时之后,立马被删除了。
有网友突然发现,WizardLM的模型权重、公告帖子全部被删除,并且不再微软集合中,除了提到站点之外,却找不到任何证据证明这个微软的官方项目。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
GitHub项目主页已成404。

项目地址:https://wizardlm.github.io/
包括模型在HF上的权重,也全部消失了.....

全网满脸疑惑,WizardLM怎么没了?

然鹅,微软之所以这么做,是因为团队内部忘记对模型做「测试」。
随后,微软团队现身道歉并解释道,自几个月前WizardLM发布以来有一段时间,所以我们对现在新的发布流程不太熟悉。
我们不小心遗漏了模型发布流程中所需的一项内容 :投毒测试

微软WizardLM升级二代
去年6月,基于LlaMA微调而来的初代WizardLM一经发布,吸引了开源社区一大波关注。

论文地址:https://arxiv.org/pdf/2304.12244.pdf
易标AI
告别低效手工,迎接AI标书新时代!3分钟智能生成,行业唯一具备查重功能,自动避雷废标项
135
查看详情
随后,代码版的WizardCoder诞生——一个基于Code Llama,利用Evol-Instruct微调的模型。
测试结果显示,WizardCoder在HumanEval上的pass@1达到了惊人的 73.2%,超越了原始GPT-4。

时间推进到4月15日,微软开发者官宣了新一代WizardLM,这一次是从Mixtral 8x22B微调而来。
它包含了三个参数版本,分别是8x22B、70B和7B。

最值得一提的是,在MT-Bench基准测试中,新模型取得了领先的优势。

具体来说,最大参数版本的WizardLM 8x22B模型性能,几乎接近GPT-4和Claude 3。
在相同参数规模下,70B版本位列第一。
而7B版本是最快的,甚至可以达到与,参数规模10倍大的领先模型相当的性能。

WizardLM 2出色表现的背后的秘诀在于,微软开发的革命性训练方法论Evol-Instruct。
Evol-Instruct利用大型语言模型,迭代地将初始指令集改写成越来越复杂的变体。然后,利用这些演化指令数据对基础模型进行微调,从而显著提高其处理复杂任务的能力。
另一个是强化学习框架RLEIF,也在WizardLM 2开发过程中起到了重要作用。
在WizardLM 2训练中,还采用了AI Align AI(AAA)方法,可以让多个领先的大模型相互指导和改进。
AAA框架由两个主要的组件组成,分别是「共同教学」和「自学」。
共同教学这一阶段,WizardLM和各种获得许可的开源和专有先进模型进行模拟聊天、质量评判、改进建议和缩小技能差距。

通过相互交流和提供反馈,模型可向同行学习并完善自身能力。
对于自学,WizardLM可通过主动自学,为监督学习生成新的进化训练数据,为强化学习生成偏好数据。
这种自学机制允许模型通过学习自身生成的数据和反馈信息来不断提高性能。
另外,WizardLM 2模型的训练使用了生成的合成数据。
在
研究人员看来,大模型的训练数据日益枯竭,相信AI精心创建的数据和AI逐步监督的模型将是通往更强大人工智能的唯一途径。
因此,他们创建了一个完全由AI驱动的合成训练系统来改进WizardLM-2。

手快的网友,已经下载了权重
然而,在资料库被删除之前,许多人已经下载了模型权重。
在该模型被删除之前,几个用户还在一些额外的基准上进行了测试。

好在测试的网友对7B模型感到印象深刻,并称这将是自己执行本地助理任务的首选模型。

还有人对其进行了投毒测试,发现WizardLM-8x22B的得分为98.33,而基础Mixtral-8x22B的得分为89.46,Mixtral 8x7B-Indict的得分为92.93。
得分越高越好,也就是说WizardLM-8x22B还是很强的。

如果没有投毒测试,将模型发出来是万万不可的。
大模型容易产生幻觉,人尽皆知。
如果WizardLM 2在回答中输出「有毒、有偏见、不正确」的内容,对大模型来说并不友好。
尤其是,这些错误引来全网关注,对与微软自身来说也会陷入非议之中,甚至会被当局调查。
有网友疑惑道,你可以通过「投毒测试」更新指标。为什么要删除整个版本库和权重?
微软作者表示,根据内部最新的规定,只能这样操作。

还有人表示,我们就想要未经「脑叶切除」的模型。

不过,开发者们还需要耐心等待,微软团队承诺,会在测试完成后重新上线。
以上就是发布几小时,微软秒删媲美GPT-4开源大模型!竟因忘记投毒测试的详细内容,更多请关注其它相关文章!
# 训练
# 深度seo网站引流
# 泰州网站推广微馨hfqjwl下拉
# 丹东seo入门公司推荐
# 优化网站优化设计的方法
# 参数设置
# 结构化
# 大波
# 实拍
# 进行了
# 而来
# 几个
# 新能源
# 开源
# 微软
# llama
# claude
# git
# 数据
# 关键词排名有sp标志
# 宣城网站建设推广
# 兰州seo优化入门
# 金立网站建设工作内容
# 岑巩网站推广
# 建设部网站男人礼物
相关栏目:
【
行业资讯67740 】
【
技术百科0 】
【
网络运营39195 】
相关推荐:
手机拍电脑屏幕有条纹怎么解决
j*a数组对象怎么取
单片机是怎么复位的
怎么自学typescript
debian和ubuntu的区别是什么
折叠手机内屏为什么会坏
如何修改cad命令
什么软件能下载夸克视频
自由服务器如何做动态ip域名解析
春运抢票要用抢票软件吗
awk命令如何对两列加分隔符
春运抢票失败怎么抢
1kb等于多少字节
固态硬盘损坏如何修复
如何查看硬盘是固态硬盘
如何打开命令框
市盈率负值是什么意思
春运抢票用不用取票码
typescript如何使用viewer
单片机学习视频怎么调色
单片机蓝牙怎么开启设备
旧固态硬盘如何卖出
如何在昇腾Ascend 910B上运行Qwen2.5教程
360n6锁屏壁纸怎么设置
固态硬盘 如何分区
华为5g手机怎么用4g网络
如何辨别固态硬盘坏块
如何检测固态硬盘温度
硬件如何执行命令
油电混动车仪表盘上的power是什么意思
怎么批量烧写单片机
电脑显示器上power是什么意思
soup是什么意思
openwrt有什么用
市盈率300是什么意思
如何使用命令行界面
征信不好如何短期恢复
vivo手机nfc功能是什么意思
如何清理固态硬盘
爱玛电动车power模式是什么意思
如何查看网站域名解析
rxjs和typescript什么意思
faq是什么意思
如何弄坏固态硬盘
oppo手机nfc功能是什么意思
华为的nfc功能是什么意思
虚拟机服务器如何关机命令
苹果的type-c接口是什么
光刻机的分类及特点
如何注释typescript


2024-04-23
浏览次数:次
返回列表