马斯克突发新版大模型,牺牲特斯拉资源叫板OpenAI,一手实测来了

 人参与 | 时间:2024-09-14 04:21:25

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

马斯克旗下xAI大模型,马斯模型出二代了!克突

Grok-2测试版发布,发新临沂市某某旅行用品制造厂小杯Grok-2 mini已经在平台在线可玩。版大板



马斯克还以谜语人的牺牲形式,揭晓了困扰大模型圈一个多月的拉资秘密:

原来Lmsys大模型竞技场上的神秘匿名模型sus-column-r,真身就是源叫Grok-2。



sus-column-r在排行榜上积累了1万多人类投票,手实测已经与GPT-4o的马斯模型API版并列第三



在xAI自己的克突临沂市某某旅行用品制造厂内部测试中,Grok-2在常识(MMLU、发新MMLU-Pro)、版大板数学竞赛问题(MATH)、牺牲研究生水平科学知识(GPQA)等领域与其他前沿模型相媲美。拉资

另外Grok-2最擅长基于视觉的源叫任务,在视觉数学推理(MathVista)达到SOTA。



不过这个图的排版可就有点心机在里面了:把分数最高的GPT-4o、Claude-3.5-Sonnet放得离自己远一些。

光看分数还是抽象,下面就进入一手实测环节。

一手实测Grok-2

如果你是/推特平台付费用户,可以直接进入Grok频道试玩。不花钱的