ברקלי משחררת את FreeToken: ביצועים חסרי תקדים של מודלים גדולים על כרטיסי מסך צרכניים
אוניברסיטת ברקלי חשפה את FreeToken, מערכת חדשה שמאפשרת להפעיל מודלים גדולים של שפה (LLM) על כרטיסי מסך צרכניים רגילים, ובכך משנה את כללי המשחק בתחום הבינה המלאכותית. התוצאות מדהימות: Qwen3.6-35B, מודל בן 35 מיליארד פרמטרים, פועל על כרטיס מסך של 8GB עם ביצועים של 39.3 טוקנים לשנייה – מהירות גבוהה יותר מהממוצע של מערכות ייצור. DeepSeek-V4-Flash 284B, מודל עצום בן 284 מיליארד פרמטרים, פועל על כרטיס מסך של 32GB עם 22 טוקנים לשנייה. אפילו GLM-5.2 753B, מודל ענק בן 753 מיליארד פרמטרים, פועל על כרטיס מסך של 96GB עם 14.9 טוקנים לשנייה. כל אלה מוכיחים כי FreeToken מאפשרת להפעיל מודלים גדולים פי 2-4 מהר יותר מאשר Ollama, מערכת הפעלה מקומית פופולרית.
הסוד טמון בטכנולוגיית Mixture-of-Experts (MoE). כל שכבה במודל מכילה מאות מודולים קטנים (experts) ומנגנון רוטר (router) שמבחר את המודולים הרלוונטיים לכל טוקן. Qwen3.6-35B מפעיל כ-3 מיליארד פרמטרים בלבד לכל טוקן, ו-DeepSeek-V4-Flash מפעיל 13 מיליארד פרמטרים מתוך 284 מיליארד. המשמעות היא שהחישוב אינו הגורם המגביל. המשקלים שטוקן יחיד צריך נמצאים בנוחות על כרטיס המסך, והכרטיס שומר עליהם בזיכרון מטמון.
FreeToken פותרת את הבעיה של רוחב פס זיכרון (bandwidth bottleneck) הנפוצה במערכות מסורתיות, באמצעות מנגנון ביצוע אדפטיבי לרוחב פס. זה מאפשר להפעיל מודלים גדולים על כרטיסי מסך צרכניים, בניגוד לגישות קודמות שדרשו שימוש בכרטיסים ייעודיים או שרתים עוצמתיים. פיתוח זה פותח על ידי צוות של חוקרים מובילים, כולל שואו יאנג (Shuo Yang) מבית הספר להנדסת חשמל ומדעי המחשב של ברקלי, וצוותים נוספים ממכון הטכנולוגי של מסצ'וסטס (MIT) ואוניברסיטת טקסס באוסטין (UT Austin).
השחרור של FreeToken הוא צעד משמעותי שפותח את הדלת לשימוש במודלים גדולים של שפה על מחשבים אישיים, ומאפשר לפתח יישומי בינה מלאכותית מתקדמים גם על מחשבים ביתיים.
דעתי: FreeToken היא מהפכה אמיתית. היא מוכיחה שאפשר להפעיל מודלים עצומים על חומרה צרכנית, מה שיפתח את הדלת לחידושים רבים בתחום הבינה המלאכותית. עם זאת, חשוב לזכור שמדובר בפיתוח ראשוני, וייתכן שיהיו מגבלות בביצועים או בתמיכה במודלים מסוימים. בכל מקרה, מדובר בצעד משמעותי שישפיע על עתיד הבינה המלאכותית.
