Alphabet Inc Class CGoogle released Gemini 4 Argon with strong benchmark scores and video/cybersecurity strengths, but insiders question its real-world coding performance.

กูเกิลเปิดตัวโมเดลปัญญาประดิษฐ์ระดับเรือธง Gemini 4 Argon ให้พันธมิตรด้านความปลอดภัยทางไซเบอร์กลุ่มเล็ก ๆ ได้ใช้งานแล้ว ก่อนจะขยายวงกว้างขึ้นหลังการทดสอบเพิ่มเติม โดยเริ่มจากผู้สมัครสมาชิกแบบชำระเงิน บริษัทระบุว่า Gemini 4 ทำคะแนนได้โดดเด่นในการทดสอบมาตรฐานหลายรายการ และมีคะแนนนำโมเดล Astra ของ OpenAI ในเกณฑ์วัดหนึ่งที่ประเมินความสามารถด้านความปลอดภัย อย่างไรก็ดี ผู้ที่เกี่ยวข้องโดยตรงภายในบางส่วนระบุว่าตัวชี้วัดดังกล่าวอาจไม่ได้สะท้อนประสิทธิภาพทั้งหมดของโมเดล โดยเฉพาะปัญหาในงานเขียนโค้ดบางประเภทเมื่อนำไปใช้งานจริง ขณะที่กูเกิลโต้แย้งว่าข้อกล่าวอ้างดังกล่าวไม่ถูกต้อง โดยอ้างความเห็นของโคเรย์ คาวุกคูโอกลู หัวหน้าทีม Google DeepMind ที่ระบุว่าพอใจกับประสิทธิภาพของโมเดล ก่อนหน้านี้กูเกิลเคยวางแผนเปิดตัว Gemini 3.5 Pro เมื่อเดือนมิถุนายน แต่ได้ยกเลิกแผนดังกล่าว ผู้เชี่ยวชาญชี้ว่ากูเกิลอาจกำลังเผชิญปัญหาที่เรียกว่า Benchmaxxing คือการให้ความสำคัญกับคะแนนทดสอบมาตรฐานมากเกินไป โดยเอ็ดวิน เฉิน ผู้ก่อตั้ง Surge AI กล่าวว่าการพึ่งพาคะแนนทดสอบอาจทำให้ห้องปฏิบัติการ AI มุ่งพัฒนาโมเดลให้เขียนโค้ดในภาษาบางประเภทได้ดี แทนที่จะสร้างแอปพลิเคชันที่ใช้งานง่าย อย่างไรก็ตาม วงในระบุว่า Gemini 4 ยังมีจุดแข็งด้านการทำความเข้าใจข้อมูลนอกเหนือจากข้อความ เช่น การดึงข้อมูล Metadata จากวิดีโอ รวมถึงความสามารถด้านความปลอดภัยทางไซเบอร์และการสื่อสารที่ชัดเจนเป็นธรรมชาติ
Alphabet Inc Class CGoogle released Gemini 4 Argon with strong benchmark scores and video/cybersecurity strengths, but insiders question its real-world coding performance.
OpenAI's Astra model is mentioned only as a benchmark comparison that Gemini 4 beat on one safety metric.