Alphabet Inc Class CGoogle released Gemini 4 Argon with strong benchmark scores and video/cybersecurity strengths, but insiders question its real-world coding performance.

GoogleはフラッグシップAIモデル「Gemini 4 Argon」を、少数のサイバーセキュリティパートナー向けに公開した。追加テストを経て、まず有料サブスクリプション加入者から順次対象を広げる計画だ。同社によると、Gemini 4は複数の標準ベンチマークで際立ったスコアを記録し、安全性能力を評価するある指標ではOpenAIのAstraモデルを上回った。しかし、事情に詳しい一部の関係者は、こうした指標はモデルの全性能を反映しているとは限らず、特に実運用時のある種のコーディング作業で問題があると指摘する。これに対しGoogleは、そうした主張は不正確だと反論し、Google DeepMindのチームを率いるコレイ・カヴクチュオール氏のコメントとして、モデルの性能に満足していると述べた。Googleは以前、6月にGemini 3.5 Proを投入する計画を立てていたが、これを撤回した。専門家は、Googleが「Benchmaxxing」と呼ばれる問題、すなわち標準ベンチマークのスコアを過度に重視する状況に直面している可能性があると指摘する。Surge AI創業者のエドウィン・チェン氏は、ベンチマークスコアへの依存が、AIラボに使いやすいアプリケーションの構築ではなく、特定の言語でうまくコーディングできるモデルの開発に注力させる恐れがあると述べた。一方、関係者によると、Gemini 4はテキスト以外のデータ理解、例えば動画からのメタデータ抽出において強みを持ち、サイバーセキュリティ能力や明瞭で自然なコミュニケーション能力も備えているという。
Alphabet Inc Class CGoogle released Gemini 4 Argon with strong benchmark scores and video/cybersecurity strengths, but insiders question its real-world coding performance.
OpenAI's Astra model is mentioned only as a benchmark comparison that Gemini 4 beat on one safety metric.