2025/4/16 08:43

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

IT之家故淵

科技媒體 bleepingcomputer 昨日（4 月 15 日）發(fā)布博文，報道稱 OpenAI 最新發(fā)布的 GPT-4.1 系列模型，其性能相比 GPT-4o 雖然實現(xiàn)重大飛躍，但多項跑分未能超越谷歌的 Gemini 系列。

IT之家昨日報道，OpenAI 公司發(fā)布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano，官方公布的跑分數(shù)據(jù)來看，這些模型在編程方面的能力，遠超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中，GPT-4o 的得分為 21.4%，GPT-4.5 的得分為 26.6%，而 GPT-4.1 的得分為 54.6%。

盡管性能有較大提升，不過根據(jù)多位專家測試，相比較谷歌的 Gemini 系列，GPT-4.1 對比中卻顯露劣勢。

根據(jù) Stagehand（一款生產(chǎn)級瀏覽器自動化框架）發(fā)布的基準數(shù)據(jù)，Gemini 2.0 Flash 的錯誤率僅為 6.67%，精確匹配率高達 90%，且價格低廉、速度更快。相比之下，GPT-4.1 的錯誤率高達 16.67%，成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外，哈佛大學 RNA 科學家 Pierre Bongrand 提供的數(shù)據(jù)也指出，GPT-4.1 的性價比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等競品。

在編碼專項測試中，GPT-4.1 同樣未能占據(jù)上風。Aider Polyglot 的測試結果顯示，GPT-4.1 的編碼得分僅為 52%，而 Gemini 2.5 則以 73% 的成績遙遙領先。

值得注意的是，GPT-4.1 被歸類為非推理模型（non-reasoning model），但其編碼能力仍屬行業(yè)頂尖。

給作者點贊

0 VS 0

寫得不太好

免責聲明：本文僅代表作者個人觀點，與C114通信網(wǎng)無關。其原創(chuàng)性以及文中陳述文字和內(nèi)容未經(jīng)本站證實，對本文以及其中全部或者部分內(nèi)容、文字的真實性、完整性、及時性本站不作任何保證或承諾，請讀者僅作參考，并請自行核實相關內(nèi)容。

相關鏈接

測試

小米開源首個推理大模型Xiaomi MiMo：7B參數(shù)就超越OpenAI o1-mini
快科技建嘉4-30
兩大CEO多項分歧曝光，OpenAI與微軟的“最佳合作”要破裂？
鳳凰網(wǎng)科技蕭雨4-29
谷歌宣布于 I/O 大會前一周舉辦特別節(jié)目，提前揭秘 Android 16 創(chuàng)新功能
IT之家問舟4-29
過于追求人性化：奧爾特曼稱 GPT-4o 出現(xiàn)“諂媚煩人”傾向，OpenAI 計劃在一周內(nèi)修復
IT之家問舟4-28

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王