אחד החוקרים מאחורי ChatGPT עזב את OpenAI: עכשיו הוא מהמר שהעתיד בכלל לא בצ׳אט
דיוגו אלמיידה היה אחד החוקרים ב-OpenAI שעבדו על השיטות שעזרו להפוך מודלי שפה למערכות שמבינות הוראות ומנהלות שיחה — מחקר שהוביל בהמשך ל-ChatGPT. בשנת 2024 הוא עזב את OpenAI והקים את TypeSafe AI, סטארטאפ עצמאי שכעת יוצא מחשאיות עם גיוס של 40 מיליון דולר ועם המודל הראשון שלו: Jev.
ההבדל בין Jev לבין ChatGPT מתחיל בדרך שבה הם חושבים ומחזירים תשובה. כששואלים את ChatGPT שאלה, המודל מייצר את התשובה מילה אחר מילה — או ליתר דיוק אסימון אחר אסימון. כל אסימון חדש תלוי במה שהמודל כבר כתב לפניו. לכן כתיבת תשובה ארוכה, קוד או מסמך דורשת שרשרת של מאות או אלפי פעולות עוקבות.
המודל Jev מוותר לחלוטין על החלק הזה. במקום לבקש ממנו ״תסביר לי מה לעשות״, התוכנה מגדירה מראש אילו תשובות מותרות ומבקשת ממנו לבחור ביניהן. לדוגמה: האם עסקה היא הונאה — כן או לא; לאיזו מחלקה להעביר פנייה; מה הסיכוי שלקוח יעזוב; איזו פעולה דמות במשחק צריכה לבצע; או האם מערכת אוטומטית צריכה להמשיך במסלול א׳ או ב׳.
התוצאה אינה פסקה של טקסט אלא נתונים מובנים שהתוכנה יכולה להשתמש בהם מיד, יחד עם הסתברויות ורמת ביטחון. במקום שמודל יכתוב ״לדעתי יש סיכוי גבוה שהלקוח יעזוב״ ואז תוכנה אחרת תנסה להבין את המשפט, Jev יכול להחזיר ישירות משהו בסגנון ״סיכון נטישה: גבוה, הסתברות: 87%״.
גם אופן החישוב שונה. מודל שפה מייצר את הפלט באופן סדרתי, אסימון אחרי אסימון. Jev נבנה כך שיוכל לחשב את ההחלטות שלו במקביל ולהחזיר את כל הפלט המובנה בפעם אחת. לפי TypeSafe, זה מאפשר זמני תגובה של עשרות עד מאות מילישניות במקום שניות רבות במודלים גדולים.
אבל יש כאן מחיר משמעותי: Jev לא יכול לכתוב טקסט חופשי. אי אפשר לפתוח מולו חלון כמו ChatGPT ולבקש ממנו ״כתוב לי סיפור על סמוראי ביפן״ ולקבל סיפור. הוא גם לא נועד לכתוב מאמר, לנהל שיחה טבעית או לייצר אלפי שורות קוד. במובן הזה הוא הרבה פחות כללי מ-ChatGPT.
מצד שני, אפשר בהחלט להשתמש בו בתוך צ׳אטבוט. לדוגמה, לקוח יכול לדבר עם מודל שפה רגיל, בזמן ש-Jev פועל מאחורי הקלעים ומחליט האם הלקוח זכאי להחזר, לאן להעביר את הפנייה ומה הפעולה הבאה שהמערכת צריכה לבצע. מודל השפה מדבר עם האדם; Jev מדבר עם התוכנה.
זה גם מסביר את המספרים החריגים שהחברה מפרסמת. TypeSafe טוענת שבמשימות מהסוג הזה Jev יכול להיות מהיר פי 20–200 וזול פי 40–400 ממודלי שפה בעלי רמת ביצועים דומה. מחיר הקלט עומד על 0.042 דולר למיליון אסימונים, והחברה אינה גובה כרגע על הפלט. עם זאת, אלו בעיקר בדיקות של TypeSafe עצמה, והחברה מודה שהשיפורים הגבוהים ביותר כנראה נמצאים בקצה העליון של מה שניתן לצפות לו בעולם האמיתי.
חשוב גם להבין מה פירוש הטענה ש-Jev לא ״הוזה״ כמו מודל שפה. מכיוון שהפלט האפשרי מוגדר מראש, הוא לא יכול פתאום להמציא פורמט חדש או להחזיר סוג נתון שהתוכנה אינה מצפה לו. זה לא אומר שהוא תמיד צודק — הוא עדיין יכול לקבל החלטה שגויה — אלא שהמערכת יודעת מראש בדיוק איזה סוג תשובה היא עומדת לקבל.
הרעיון של אלמיידה גדול יותר ממודל אחד. לטענתו, מודלי השפה הפכו למצוינים בשיחה עם בני אדם, אבל זה עדיין לא יצר את כמות האוטומציה שניתן היה לצפות ממערכות כל כך חכמות. TypeSafe רוצה לבנות מודלים שלא מיועדים בעיקר לדבר איתנו, אלא לשמש כמו מיליוני פונקציות חכמות בתוך תוכנה — מקבלות מצב, מקבלות החלטה וממשיכות מיד הלאה.
דעתי: זה עדיין רחוק מלהוכיח שזו הדרך ל-AGI, אבל הרעיון מסקרן מאוד. במשך השנים האחרונות ניסינו להשתמש באותו סוג מודל כמעט לכל דבר: כתיבה, תכנות, שיחה וגם החלטות קטנות בתוך תוכנה. יכול להיות שהשלב הבא יהיה דווקא פיצול — מודלים כמו ChatGPT ידברו ויחשבו איתנו, ומודלים כמו Jev יקבלו מיליארדי החלטות קטנות מאחורי הקלעים. אם זה יעבוד כפי ש-TypeSafe טוענת, חלק גדול מה-AI של העתיד אולי בכלל לא יהיה צ׳אטבוט שאנחנו רואים — הוא פשוט יהיה בתוך כל תוכנה שאנחנו משתמשים בה.
