您的当前位置：首页 > 资讯 > 创新科技 > GPT-4o mini：懂得不多，但答得极快

GPT-4o mini：懂得不多，但答得极快

时间： 2024-07-21 08:07 创新科技

昨晚，OpenAI 突然上线新模型 GPT-4o mini，声称要全面取代 GPT-3.5Turbo。

在性能方面，GPT-4o mini 在 MMLU 上的得分为82%，在 LMSYS 排行榜的聊天方面分数优于 GPT-4。

在价格方面，GPT-4o mini 比之前的 SOTA 模型便宜一个数量级，商用价格是每百万输入 token15美分，每百万输出 token60美分，比 GPT-3.5Turbo 便宜60% 以上。

OpenAI 表示，ChatGPT 的免费版、Plus 版和 Team 用户将能够从周四开始访问 GPT-4o mini（其知识截至2023年10月），以代替 GPT-3.5Turbo，企业用户可以从下周开始访问。

目前，GPT-4o mini 在 WildBench 测试上排名第九，优于谷歌的 Gemini-flash 以及 Anthropic 的 Claude3Haiku。

在今天的凌晨的文章中，我们已经介绍了 GPT-4o mini 的一些基本情况（参见《GPT-4o Mini 深夜突发:即刻免费上线，API 降价60%》）。在这篇文章中，我们将补充介绍模型的实际使用体验以及这份工作背后的研究者。

GPT-4o mini 一手评测

在 GPT-4o mini 开放测试的第一时间，我们问了它一个最近比较热门的话题，9.11和9.9哪个大，很遗憾，GPT-4o mini 依然没有答对，还一本正经地回答0.11>0.9。

接着我们在 Poe（Quora 开发的应用程序，已经集成了 GPT-4o mini）中输入人物传记电影《Eno》的设计封面，让两个模型解读，结果 mini 翻车了。GPT-4o mini 直接表示「自己认不出照片上的人。」

与之相对的，GPT-4o 的回答就比较准确。「这张图片看起来像是一幅拼贴画，由一张照片的多个碎片组成，照片中是一位留着白胡子、身穿亮粉色衬衫的老人。这幅图由同一张照片的不同部分创造性地排列而成，产生了马赛克或拼图般的效果。照片中的男子表情若有所思，手抚摸着脸。」

接着我们又测试了另一个问题:在客厅的桌子上放着一个杯子，杯子里有一个戒指。这个杯子被移到了书房的桌子上，然后移到了卧室的床上。在那里，杯子被翻倒了一次，然后又恢复了原样。之后，杯子被放回了客厅的桌子上。那么，现在戒指在哪里呢?如果我们分开问，答案不一样，GPT-4o 似乎更聪明点。

但是，如果我们一起发问，它们的答案又会变得雷同:

GPT-4o mini 回答数学题的表现如何呢?机器之心用丘成桐少年班2024年选拔试题测试了一下它解决数学问题的能力。

虽然 GPT-4o mini 对问题的解读都比较清晰，但在分析过程中出现「胡言乱语」的逻辑错误，像极了上数学课根本听不懂但硬答的学生。

不过也不必着急，毕竟 GPT-4o 的回答更不理想，它甚至没有看懂数字表示的是正方形的边长。

在文字的总结能力上，GPT-4o mini 与 GPT-4o 的能力不相上下。都能将重点信息进行抓取，但 GPT-4o 的回答更显条理。

不过主打「Faster for everyday tasks」的 GPT-4o mini，响应速度确实对得起「Faster」之称。和它对话，几乎无需等待，输出速度也是快得离谱。

日本网友用 GPT-4o mini 搭建了一款 AI 聊天机器人，响应速度依然快得惊人。

还有网友将 GPT-4o 和 GPT-4o mini 输出速度进行了对比，GPT-4o mini 明显更快:

从大家体验效果上来看，GPT-4o mini 主打一个字「快」，但实际使用体验可能还是差了一些。

责任编辑 :

[声明]本网转载的作品目的在于传递更多信息，此稿件并不代表本网的观点，本网不承担此类稿件侵权行为的连带责任。如果你认为此类稿件侵犯了您的合法权益，请将相关资质证明发送至mingyou360kf@sina.com，名优资源网工作人员会及时回复并处理！

行业标签：创新科技

相关新闻