חייגו אלינו (3) - AI Inside
חייגו אלינו (2) - AI Inside
חייגו אלינו (1) - AI Inside
חייגו אלינו (3) - AI Inside
חייגו אלינו (2) - AI Inside
חייגו אלינו (1) - AI Inside

Gemma 4 על Cerebras: המודל המולטימודלי המהיר בעולם -1,500 טוקן לשנייה

שי קליין
21/06/2026

כשמדברים על Gemma 4 Cerebras, מדברים על יותר מסתם מודל מהיר. מדברים על שינוי יסודי באופן שבו ניתן לבנות אפליקציות AI שרואות, חושבות ופועלות בזמן אמת. Cerebras, המובילה בתחום מסקנה מהירה (fast inference) למודלים בקוד פתוח, הכריזה שמודל Gemma 4 של Google DeepMind נמצא בפרימיו פרטי על הפלטפורמה שלה -עם זמינות כללית בסוף יוני 2026. זו ההשקה הראשונה של מודל Google DeepMind על Cerebras, והראשונה שמאפשרת הזנת תמונות למודל שרץ על חומרת wafer-scale.

Gemma 4 על Cerebras — מסקנה מולטימודלית ב-1500 טוקן לשנייה על חומרת wafer-scale

1,500 טוקן לשנייה: למה המספר הזה משנה הכל

1,500 טוקן לשנייה הוא לא רק מספר שנראה טוב בשקופית. זה קפיצת מדרגה שמשנה את מה שאפשר לבנות. Claude Haiku -אחד המודלים המהירים ביותר בשוק -מגיע לכ-100 טוקן לשנייה. פי 15 איטי יותר. ו-Haiku הוא עדיין מהיר בהרבה מ-GPT-4o או Claude Sonnet ב-use cases דומים.

האמת היא שלאפליקציות AI מולטימודליות ואגנטיות יש בעיה מבנית: הן לא קוראות למודל פעם אחת. הלולאה הטיפוסית נראית כך – קלט חזותי, ניתוח, פלט מובנה, קריאה לכלים, בדיקת תוצאה, ניסיון נוסף. כשכל שלב לוקח שניות, המשתמש מרגיש שהוא ממתין. כשהשלב לוקח מילישניות, האפליקציה מרגישה כמו ממשק ומשתמש שעובדים ביחד.

מדד Gemma 4 על Cerebras Claude Haiku GPT-4o Mini
מהירות פלט (TPS) 1,500+ ~100 ~80
יחס מהירות פי 15 יותר מהיר בסיס איטי יותר
מדד אינטליגנציה (AAII) 29 30 ~28
תמיכה בתמונות כן כן כן
רישיון Apache 2.0 (פתוח) קנייני קנייני
מחיר לטוקן פלט נמוך מ-Haiku בסיס דומה
ארכיטקטורה Dense (31B) Dense Dense
Cerebras Inference מריץ Gemma 4 ב-1500 טוקן לשנייה — פי 15 מ-Claude Haiku

Gemma 4 31B: מודל Dense שפוגע בנקודת האיזון הנכונה

Gemma 4 31B הוא המודל הפלגשיפ במשפחת Gemma של Google DeepMind -מודל dense ומולטימודלי שנבנה לאיכות ויעילות, לא לכמות פרמטרים. המשמעות המעשית: ביצועים גבוהים בלי טביעת זיכרון ענקית כמו שנדרשת למודלי MoE (Mixture of Experts), מה שמאפשר לו לרוץ בצורה יעילה יותר על חומרה.

ב-Artificial Analysis Intelligence Index, Gemma 4 31B מקבל ציון 29 -בדיוק רמת Claude Haiku (30). אבל כאן המצב הופך מעניין: Gemma 4 הוא מודל קוד פתוח תחת רישיון Apache 2.0. אין vendor lock-in, אין מגבלות שימוש מסחרי, ואפשר לפרוס אותו on-premise אם זה מה שהארגון צריך. בשילוב עם מהירות Cerebras, זה מציע שילוב שלא היה קיים עד עכשיו: מודל פתוח ברמת Haiku, שרץ פי 15 מהר יותר.

יכולות מולטימודליות: מה Gemma 4 יכול לראות ולנתח

Gemma 4 מנתח תמונות, דשבורדים ומסמכים — יכולות מולטימודליות על Cerebras

Gemma 4 הוא המודל הראשון על פלטפורמת Cerebras שתומך בהבנת תמונות. ניתן להזין לו: צילומי מסך, תרשימים, ממשקי UI, דפי מסמכים סרוקים, טפסים ודיאגרמות. עבור Cerebras, זהו מאבן הדרך: מסקנה חזותית על חומרת wafer-scale.

ה-use cases שנפתחים כתוצאה מכך משנים את הדינמיקה של בניית מוצרי AI:

ניתוח צילומי מסך בזמן אמת

מזינים לדגם צילום מסך של דשבורד עמוס נתונים או עמוד מסמך -הוא מזהה מה חשוב, מסביר את הממצא ומחזיר פלט מובנה בזמן אמת ולא אחרי המתנה.

סיכום Long-Context

מעבירים לו דוח מחקר או בריף טכני -מקבלים סיכום מוכן להחלטה מהר מספיק כדי לקרוא, להגיב ולשאול שאלת המשך באותה ישיבה.

Screenshot to Patch

מזינים צילום מסך של ממשק שבור, קוד המקור ושגיאת הקונסול -הדגם מחזיר patch מינימלי ואת הבדיקות לאימות התיקון. use case שמנגן יפה עם מה שראינו בסוכני AI לפיתוח קוד.

Computer Use ו-Robotics

שילוב ראייה + מהירות wafer-scale פותח דלת לאפליקציות computer use: מודל שרואה דשבורד, מנתח אותו, מחזיר פלט מובנה ופועל על פיו -מהר מספיק כדי לשמור אדם או סוכן בלולאה. זהו כיוון שמתחבר ישירות לדיונים על האינטגרציות של AI בתוך מערכות הפעלה.

Cerebras ומשפחת המודלים: Gemma 4 מצטרף לקטלוג

Cerebras הוקמה כפלטפורמת inference מהירה ובנתה את המוניטין שלה על מודלים כמו Kimi, GLM, GPT-OSS ו-Qwen. Gemma 4 הוא המודל הראשון של Google DeepMind על הפלטפורמה -ועל פי Cerebras, הוא גם מהווה את "reference medium model" שלה. כלומר: אם חושבים לעבור מ-Llama, GPT-OSS או Claude Haiku, Gemma 4 על Cerebras הוא ה-migration path המומלץ.

Cerebras הצהירה גם שתמיכה מולטימודלית תורחב למודלים נוספים בעתיד -Gemma 4 הוא הראשון, לא האחרון. זה ממצב את Cerebras לא רק כפלטפורמת טקסט מהירה אלא כסביבה שלמה לאפליקציות vision + language.

זמינות ותמחור

Gemma 4 נכנס ל-Private Preview על Cerebras ב-18 ביוני 2026, עם זמינות כללית (GA) בסוף יוני. המחיר לטוקן פלט נמוך ממחיר Claude Haiku – Cerebras לא פרסמה מחירון מדויק, אבל הצביעה על יתרון מחיר ממשי. מי שבונה workflow מולטימודלי ומהירות מסקנה היא הצוואר הבקבוק, מוזמן ליצור קשר עם Cerebras עכשיו כדי להיכנס ל-preview.

"בחרנו להביא את Gemma 4 ראשון כי הוא מגיע לאותה רמת איכות של מודלים ייצוגיים קיימים – אבל עכשיו עם ראייה, בקוד פתוח, ובמהירות שלא ראינו עדיין בפלטפורמות inference."

Cerebras, הכרזת Gemma 4, יוני 2026

שאלות נפוצות – Gemma 4 ו-Cerebras

מה זה Gemma 4 Cerebras ולמה זה חשוב?

מודל מולטימודלי בקוד פתוח של Google DeepMind שרץ על Cerebras במהירות 1,500+ טוקן לשנייה – פי 15 מ-Claude Haiku – ברמת איכות דומה ובמחיר נמוך יותר לטוקן. הראשון מסוגו על פלטפורמת Cerebras.

כמה מהיר Gemma 4 לעומת מתחרים?

1,500+ TPS לעומת ~100 TPS של Claude Haiku ו-~80 TPS של GPT-4o Mini. על מדד האינטליגנציה של Artificial Analysis: Gemma 4 מקבל 29, Haiku מקבל 30 – רמה דומה, מהירות פי 15.

מתי Gemma 4 זמין על Cerebras?

Private Preview: 18 ביוני 2026. General Availability: סוף יוני 2026.

מקורות: Cerebras Blog – Gemma 4 on Cerebras | Artificial Analysis Intelligence Index – Gemma 4 | Google DeepMind – Gemma 4

Gemma 4 על Cerebras — מסקנה מולטימודלית ב-1500 טוקן לשנייה על חומרת wafer-scale

סרטון סקירה כללית

רוצים הרצאה או ייעוץ של המומחים שלנו ?

השאירו פרטים ונשמח לחזור אליכם עם מידע רלוונטי

רוצים להיות הראשונים לדעת על כל החידושים והעדכונים בעולם ה-AI?

הרשמו לקבוצת הוואצסאפ שלנו.

מדוע ארגונים מובילים בוחרים ב-idesign4u להטמעת AI?

ארגונים בוחרים בנו כי אנחנו לא רק מדברים על טכנולוגיה, אלא חיים אותה בשטח. עם ניסיון של מעל שני עשורים בדיגיטל ופיתוח פתרונות AI מעשיים, אנו מביאים איתנו מתודולוגיה מוכחת שעברה בהצלחה בגופים הגדולים בישראל (כמו הכנסת ומשרדי ממשלה, אוניברסיטאות, החברות המובילות במשק, חברות רכב, חברות הייטק, חברות בטחוניות ועוד). אנחנו מחברים בין חזון טכנולוגי לבין יעדים עסקיים בשטח.

הייחודיות שלנו טמונה בגישת ה-Hands-on. בניגוד להרצאות תיאורטיות, הסדנאות שלנו מבוססות על פיצוח "כאבי בטן" אמיתיים של הארגון. אנו משלבים למידה אקטיבית, בניית ספריות פרומפטים מותאמות אישית, ותרגול על כלי ה-AI המתקדמים ביותר (ChatGPT, Claude, Midjourney ועוד) – כך שהעובדים יוצאים עם כלים ליישום מיידי כבר בדקה שאחרי הסדנה.

בהחלט. הבינה המלאכותית היא "השפה האנושית החדשה", והכלים שאנו מלמדים נועדו להנגיש טכנולוגיה לכולם. הסדנאות שלנו בנויות בצורה מודולרית ומותאמות לכל רמות הידע – החל מעובדי שטח ואדמיניסטרציה ועד למנהלי פרויקטים בכירים. המטרה שלנו היא להפיג חששות ולהפוך את ה-AI לשותף פעיל ופשוט לעבודה.

אין אצלנו "מוצר מדף" אחיד. לפני כל הרצאה או סדנה, אנו מקיימים תהליך אפיון קצר מול גורמי המפתח בארגון. אנו לומדים את עולמות התוכן שלכם, מזהים תהליכים שניתן לייעל, ומתאימים את הדוגמאות והתרגילים כך שיהיו רלוונטיים ב-100% ליום-יום של המשתתפים.

בוודאי. אנו מציעים קשת רחבה של פורמטים: החל מהרצאות השראה (Keynote) לכנסים והנהלות, דרך סדנאות בוטקאמפ אינטנסיביות, ועד לליווי אסטרטגי ארוך טווח להטמעת AI רוחבית. כל פעילות נתפרת לפי המטרות הספציפיות שלכם – בין אם מדובר בייעול תפעולי, שדרוג מערך השיווק או שיפור קבלת החלטות ניהוליות.

כל מה שצריך זה סקרנות ומחשב נייד (במקרה של סדנה). אנחנו דואגים לכל השאר. לפני המפגש נשלח רשימת דגשים טכניים קלה (כמו הרשמה לכלי AI מסוימים) כדי שנוכל לנצל את זמן המפגש ללמידה ותרגול מקסימלי.

התשובה: אנחנו זמינים עבורכם לכל שאלה, התייעצות או תיאום פגישת אפיון. אתם מוזמנים ליצור איתנו קשר ישירות:

  • בטלפון: 04-6000444

  • במייל: [email protected] (עמית) או [email protected] (שי).

  • לקפה פנים אל פנים: אנחנו יושבים בדרך חיפה 37, קרית אתא. נשמח לשמוע על הארגון שלכם ולבנות יחד את המפגש המדויק עבורכם.