شرکت اسپیسایکسایآی از Grok 4.6 رونمایی کرد؛ مدلی که بر کارهای عاملمحورِ طولانی، پژوهش چندمرحلهای، تحلیل اطلاعات و ساخت خروجیهای بصری و تعاملی تمرکز دارد. پیام اصلی روشن است: گراک جدید فقط برای پاسخگویی سریع طراحی نشده، بلکه قرار است مسیر یک پروژه را از ایده تا نسخهی نهایی دنبال کند.
بر اساس بیانیهی مطبوعاتی اسپیسایکسایآی، گراک ۴٫۶ در چند بنچمارک کلیدیِ کدنویسی و دانشمحور به سطح «پیشرو» رسیده و در Artificial Analysis Intelligence Index با ۶۱ امتیاز، با GPT-5.6 Sol Max برابر شده است. در همین ارزیابی، Fable 5 Max با امتیاز ۶۲ بالاتر ایستاد و Grok 4.5 High با امتیاز ۵۶ عقبتر ماند.
جدول رسمی نشان میدهد نسخهی جدید گراک در GDPVal-AA v2 امتیاز ۱۷۵۳ گرفت، در CursorBench v3.2 به ۶۹٫۹ درصد رسید، در DeepSWE v1.1 عدد ۶۵٫۹ درصد را ثبت کرد و در FrontierCode v1.1 (Extended) به ۶۱٫۳ درصد دست یافت.
اسپیسایکسایآی میگوید این مدل یک دورهی تکمیلیِ طولانیتر از گراک ۴٫۵ پشت سر گذاشته است؛ دورهای که در آن از دادههای تولیدشدهی مدل برای استدلال، مفاهیم فنی پیشرفته، دادههای مهندسی باکیفیت و یک بهینهسازِ بهروزشده استفاده شده است.
گراک ۴٫۶ در پروژههایی که نیاز دارند یک ایدهی کلی به نسخهی کاریِ اولیه تبدیل شود، عملکرد بهتری نسبتبه نسل قبل نشان داده است. مدل میتواند دربارهی حوزهای ناآشنا تحقیق کند، ساختار اپلیکیشن را بچیند، هستهی تعاملها را پیادهسازی کند و در چند دور بازخورد، کار را جلو ببرد. در مسیرهای طولانیتر، نشانههایی از تست خودکار و فرآیند احراز نهایی هم دیده شده؛ یعنی مدل پیش از رفتن سراغ مرحلهی بعد، کار خودش را بررسی میکند.