当前位置:首页 > 元宇宙 > AI

斯坦福大模型评测榜 Claude 3 排名第一,阿里 Qwen2、零一万物 Yi Large 国产模型进入前十

来源: 责编: 时间:2024-06-25 17:11:53 257观看
导读 6 月 22 日消息,斯坦福大学基础模型研究中心(CRFM)6 月 11 日发布了大规模多任务语言理解能力评估(Massive Multitask Language Understanding on HELM)排行榜,其中综合排名前十的大语言模型中有两款来自中国厂商,分

6 月 22 日消息,斯坦福大学基础模型研究中心(CRFM)6 月 11 日发布了大规模多任务语言理解能力评估(Massive Multitask Language Understanding on HELM)排行榜,其中综合排名前十的大语言模型中有两款来自中国厂商,分别是阿里巴巴的 Qwen2 Instruct(72B)和零一万物的 Yi Large(Preview)。siK28资讯网——每日最新资讯28at.com

据悉大规模多任务语言理解能力评估(MMLU on HELM)采用了 Dan Hendrycks 等人提出的一种测试方法,用于衡量文本模型在多任务学习中的准确性。这个测试内容包括基础数学、美国历史、计算机科学、法律等领域的 57 个任务。要在这个测试中获得高分,模型必须具备广泛的世界知识和解决问题的能力。附排名如下:siK28资讯网——每日最新资讯28at.com

siK28资讯网——每日最新资讯28at.com

▲ 图源斯坦福大学基础模型研究中心官网

1、Claude 3 Opus(20240229): Anthropic(美国,亚马逊投资)siK28资讯网——每日最新资讯28at.com

2、GPT-4o(2024-05-13):OpenAI(美国)siK28资讯网——每日最新资讯28at.com

3、Gemini 1.5 Pro:谷歌(美国)siK28资讯网——每日最新资讯28at.com

4、GPT-4(0613):OpenAI(美国)siK28资讯网——每日最新资讯28at.com

5、Qwen2 Instruct(72B):阿里巴巴(中国)siK28资讯网——每日最新资讯28at.com

6、GPT-4 Turbo(2024-04-09):OpenAI(美国)siK28资讯网——每日最新资讯28at.com

7、Gemini 1.5 Pro(0409 preview):谷歌(美国)siK28资讯网——每日最新资讯28at.com

8、GPT-4 Turbo(1106 preview):OpenAI(美国)siK28资讯网——每日最新资讯28at.com

9、Llama 3(70B):Meta(美国)siK28资讯网——每日最新资讯28at.com

10、Yi Large(Preview):零一万物(中国)siK28资讯网——每日最新资讯28at.com

Qwen2 是由阿里巴巴开发的一款开源大语言模型,发布于今年 6 月 6 日。Qwen2 系列包括 Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B 和 Qwen2-72B 在内的五个不同规模的预训练及指令微调模型;支持除英语和中文外的额外 27 种语言的数据训练;Qwen2-7B-Instruct 和 Qwen2-72B-Instruct 支持长 128K 个 token 的上下文。siK28资讯网——每日最新资讯28at.com

Yi Large 是由零一万物公司开发的一款闭源大模型,Yi 模型系列基于 6B 和 34B 预训练语言模型,然后扩展到聊天模型、200K 长上下文模型、深度升级模型和视觉语言模型。官方宣称“其在关键基准测试分数上优于 GPT-4 和 Claude 3 Opus 等领先模型”。siK28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-4773-0.html斯坦福大模型评测榜 Claude 3 排名第一,阿里 Qwen2、零一万物 Yi Large 国产模型进入前十

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: GPT-4o 差点没及格!首个多任务长视频评测基准,它有亿点难

下一篇: 消息称苹果与 Meta 讨论合作,将生成式 AI 引入 Apple Intelligence

标签:
  • 热门焦点
  • 元宇宙终究没火过两年

    来源:传播体操在ChatGPT快速破圈的同时,元宇宙的热度却一泻千里。虽然互联网大厂们都没有否认元宇宙的长期想象力,但在行动上却都纷纷表示了对元宇宙短期前景的悲观。号称改变
  • 新周期,谁在坚守窄门?

    来源:锦缎今日的投资者恐怕已经忘记了,在OpenAI创造出ChatGPT这一杀器的前夜,生成式AI也曾经是一道窄门,窄到连马斯克都差点失去了信心。在当时的舆论眼中,AGI的道路不够性感,不够
  • “平均时代”:ChatGPT模仿秀的隐喻

    来源:锦缎如果你问ChatGPT,Instagram上最美的女人是谁?它很可能会给你一个名字,叫卡戴珊。如果你观察过Instagram这个美版小红书:平台上的所有网红,展现的几乎是统一面孔:统一的医
  • 字节、腾讯、网易鏖战元宇宙背后,大厂究竟在争夺什么?

    正当互联网商业踌躇不前,互联网大厂为了在存量中的增长挤破头皮之时,元宇宙的概念被资本点燃。先是Facebook更名Meta正式进军元宇宙,然后字节跳动收购了一家VR硬
  • 《刀剑神域》VR展开幕;《Puzzling Places》发布第二个付费DLC

    今日热点:《刀剑神域:Ex-Chronicle Online Edition》VR展开幕;虚拟活动平台EventX再获800万美元B轮融资;VR射击游戏《Outlier》确认将于3月17日登陆Steam平台等。
  • NFT:新骗局的狩猎场

    骗局的自动化需要更好的防御,从数字身份开始。前几天我在OpenSea上购买了一个NFT,是才华横溢的艺术家海伦·福尔摩斯 (Helen Holmes) 的漫画,来自她的 "原作 "收
  • 韩国流行音乐巨头SM与Binance达成NFT合作伙伴关系

    韩国流行音乐巨头 SM Entertainment 与加密货币交易所 Binance(币安)达成“Play2Create”NFT 合作伙伴关系。SM 娱乐一直在投资打造元宇宙该公司于 2020 年 10
  • NFT高玩必备:NFT分析工具大盘点

    NFT市场的火热让越来越多的投资者投身其中,但当前的 NFT 生态系统存在几个问题却困扰了大多数人,如难以准确评估 NFT 项目的资产价格、缺乏 NFT 市场动态信息、
  • 76亿美金估值、2022年最具创新力公司,Dapper Labs如何做到?

    “元宇宙的开拓者”是我们针对元宇宙的发展而设立的专栏,主要面向那些深挖元宇宙产业或者在元宇宙进行“淘金”的从业者,分享这些企业或者创业者们的故事,以独特
Top