每日快看:谷歌「史上最差」AI模型發(fā)布! Gemini 3.5 Pro延期
新智元報道
從未見過如此糟糕的模型!
Gemini 3.5 Pro正式版沒來,3.6 Flash、3.6 Flash Lite等Gemini 3.6「閹割版」發(fā)布了!
(資料圖片僅供參考)
就在昨夜,谷歌DeepMind宣布,推出三款模型,分別為Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。
在Vertex AI上線后,谷歌最新發(fā)布的Gemini 3.6 Flash口碑遭遇滑鐵盧。
早期實測顯示,該模型在前端界面生成與空間推理方面表現(xiàn)極差,被用戶戲稱為「史上最差」。
好消息,Gemini 3.6 Flash比GeminI 3.1 Pro、Gemini 3.1 Pro強,主打「性價比」。
然而網(wǎng)友們關(guān)心的是:我那么大一個Gemini 3.5 Pro呢?
谷歌「史上最差」AI模型發(fā)布!
谷歌新模型,上線就被罵「史上最差」了。
從前端到空間推理,得到的全是差評。
先看前端生成。
Gemini-3.6 Flash前端能力全線崩盤,在前端代碼競技場中不敵Claude Fable 5、GPT-5.6 Sol等當紅模型,甚至不如Meta的Muse Spark 1.1。
開發(fā)者用2-shot測試Gemini 3.6 Flash的界面生成能力,這本是Flash系列最擅長的場景之一。
結(jié)果出來,直接懵了。
輸出的界面代碼邏輯錯亂,組件嵌套混亂,交互邏輯斷裂,完全無法投入實際使用。
「這是我真正見過的最差結(jié)果?!?/p>
這句話配上截圖,在開發(fā)者社區(qū)迅速傳播。
再看空間推理。
他還專門錄制了視頻,逐幀測試Gemini 3.6 Flash在空間關(guān)系理解上的表現(xiàn)。
測試結(jié)果同樣讓人失望:模型頻繁出錯,對基礎(chǔ)的位置關(guān)系、方向判斷的準確率,相比3.5 Flash明顯退步。
他也只能自我安慰可能自己沒有開啟高性能模型「high thinking」。
遺憾的是,即便開啟,也沒有最好的結(jié)果可以報告,另一個網(wǎng)友使用了高推理強度,第一印象不佳。
木紋紋理看起來還行,沒什么特別之處。
大理石近距離看反射效果還不錯,但存在 bug。
第二印象甚至更差:
CursorBench上,Gemini 3.6 Flash還不如Cursor的Composer 2.5。
谷歌發(fā)布的測試結(jié)果,也顯示Gemini 3.6 Flash在代碼任務(wù)上被其他模型超越,僅在視覺和上下文基準測試中持續(xù)保持領(lǐng)先水平。
但在第三方綜合測評Artificial Analysis上,Gemini 3.6 Flash得分與3.5 Flash完全相同,表現(xiàn)不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra……
有網(wǎng)友發(fā)現(xiàn)它的知識截止日期實際上并未更新到它所聲稱的時間,直言:
這是一個未完成的模型。
它聲稱是2026年3月,但實際上它對 2026 年甚至 2025 年的大部分內(nèi)容一無所知。它的實際知識似乎停留在 2025 年1月。
Gemini 3.5 Flash-Lite則主打速度快,每秒可輸出350個token。
速度確實快了。但快有什么用?快速給出一個錯誤答案,等于用更高的效率浪費用戶的時間。
更何況,和競爭對比手,價格更貴,效果更差!
此外 ,谷歌這次還發(fā)布了網(wǎng)絡(luò)安全模型Gemini 3.5 Flash Cyber。
谷歌:Gemini 3.5 Pro延期、4已預(yù)訓(xùn)練
在算力緊缺的時代,發(fā)布一個邏輯混亂的模型,是否也是瀆職?
有用戶諷刺稱,DeepMind 這種浪費算力的行為,還不如直接將資源轉(zhuǎn)讓給Moonshot等競爭對手。
這番言論背后,是開發(fā)者對谷歌「版本號游戲」的深層厭惡。
谷歌似乎陷入了某種「官僚主義的指標狂熱」:為了在財報和發(fā)布會上展示更高的版本號、更快的推理速度,他們犧牲了AI最本質(zhì)的東西——真實效用。
3.6 Flash的發(fā)布公告中,谷歌提到,Gemini 3.5 Pro還沒有完全準備好,而Gemini 4已開始「目前最雄心勃勃的預(yù)訓(xùn)練」,并「對取得的進展感到非常振奮」。
推測來看,近期3.5 Pro的開發(fā)進展并不理想,因此他們啟動了全新的預(yù)訓(xùn)練課程。
據(jù)CNBC報道,這是谷歌「有史以來規(guī)模最大的預(yù)訓(xùn)練項目」。
這次谷歌步子邁大了。
谷歌這種趕鴨子上架,敗壞口碑的做法到底圖什么?
谷歌還能在AGI競賽中有一席之地嗎?
參考資料:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
https://x.com/Waguri_Kaoruko8/status/2079432904283754652
編輯:大衛(wèi)