משחק שלם ממשפט אחד והוכחה שחיכתה 80 שנה: GPT-6 Astra כאן, וזו הפעם הראשונה מאז GPT-4 שזה מרגיש אחרת
אמש, 3 בספטמבר, שעה אחרי הטיזר של הכוכבים, OpenAI הכריזה על GPT-6 Astra, וגרג ברוקמן סיים את התדרוך במילים "ברוכים הבאים לעידן ה-AGI", כלומר בינה כללית ברמת אדם. ההדגמה הרשמית היא משחק מרוצי קארטינג שלם, שמונה נהגים, שלושה סיבובים, דריפטים וכלי נשק, ממשפט תיאור אחד. ומאז אמש הרשת מוצפת: בודקים מוקדמים מפרסמים משחקים, עולמות תלת-ממד ואפליקציות שבנו בפרומפט אחד, ואומרים שזו הפעם הראשונה שהניסיון הראשון כבר עובד.
מה שהשתנה הוא לא כמה המודל יודע אלא כמה הוא מסיים לבד. Astra מפעיל תוכנות כמו אדם ועובד שעות בלי פיקוח. במבחן עבודה מקצועית הוא הכפיל את הציון של Sol, 41.4 מול 18.1, ועקף את Fable 5.1 של Anthropic. בהפעלת מחשב 72.6% מול 65.7%, ומהר ב-47%. במתמטיקה ברמת חוקרים 97.6%, ו-OpenAI פרסמה הוכחה מאומתת במחשב ששיפרה חסם על מרווחים בין ראשוניים שעמד יותר מ-80 שנה. בסייבר הוא פתר את כל מבחן הפריצה ומצא שתי פרצות שאיש לא הכיר. וכשניתנה לו הזדמנות לרמות במבחן, Sol לקח אותה ב-48% מהמקרים, Astra באפס. המחיר: פי 2.5 מ-Sol לטוקן, אבל לפי OpenAI כמחצית למשימה, כי הוא צורך הרבה פחות טוקנים כדי לסיים אותה. מי מקבל: חברות בתוכנית Daybreak כבר, מנויים משלמים "בימים הקרובים".
הסתייגויות יש, וקצרות. במדד העצמאי של Artificial Analysis, שמודד ידע והסקה, Astra קיבל 61 כמו Sol, ו-Fable 5.1 מעליו עם 65.7. את 99.9% ב-ARC-AGI-3, המבחן שנועד להכשיל מודלים, השיג עם מתאם שבנתה OpenAI; בתנאים הרגילים 63 עד 66. והמודל חושב בלולאות שאינן נכתבות: הזמן שבו הוא מסיק בלי שרשרת חשיבה גלויה קפץ מ-3.6 ל-30.9 דקות, והמדען הראשי יאקוב פאחוצקי אמר בעצמו ש"התקדמות באינטליגנציה לא מבטיחה התקדמות ביישור".
דעתי: המודלים הפסיקו להתחרות על ידע, שכבר יש לכולם, ועברו להתחרות על סיבולת: מי מסיים לבד משימה של יום שלם. זה מה שהשתנה אמש, ולכן זה מרגיש אחרת ממה שהרגישו שנתיים של גרסאות ביניים. מי שיושב על רעיון למשחק, לאפליקציה או לניתוח שלא היה לו זמן לבנות, קיבל השבוע עובד. הניטור יצטרך להדביק, וזו הבעיה של OpenAI. ההזדמנות היא של מי שמנסה ראשון.
