[ ARTICLE · 18.07.2026 ]

גוגל מפצלת את ה-TPU לשניים: שבב אימון מברודקום, שבב אינפרנס ממדיהטק

עד עכשיו, כל דור TPU של גוגל היה שבב אחד שמשרת גם אימון וגם אינפרנס, בגוונים שונים. באפריל 2026, ב-Google Cloud Next, גוגל שברה את הדפוס הזה. הדור השמיני של ה-TPU יגיע כשני שבבים נפרדים לגמרי — לא וריאציות של אותה ארכיטקטורה, אלא שני עיצובים שונים עם שני שותפי שבבים חיצוניים שונים. זהו הימור אסטרטגי ברור: שגוגל מאמינה שהעתיד של AI לא נראה כמו עומס עבודה אחיד, אלא כשני משטרים נפרדים לגמרי שדורשים חומרה שונה.

Sunfish: שבב האימון שנולד עם ברודקום

TPU 8t, בשם קוד Sunfish, הוא שבב האימון של הדור החדש, מעוצב בשיתוף פעולה עם ברודקום. הארכיטקטורה שלו כוללת שני dies חישוביים, die קלט/פלט אחד, ושישה מחסני זיכרון HBM3e לכל צד — סך הכול תצורה שמספקת 216 ג'יגה-בייט זיכרון בקצב תעבורה של 6,528 ג'יגה-בייט לשנייה. השבב תומך בפורמט FP4 חדש לצד BF16, INT8 ו-FP8 הקיימים, ומגיע לשיא של 12.6 פטהפלופס FP4.

מבחינת קנה מידה, Sunfish תוכנן לתמוך בסופר-פוד (superpod) של 9,600 שבבים המחוברים בטופולוגיית תלת-ממד טורוס (3D torus) עם רוחב פס בין-שבבי כפול לעומת הדור הקודם. גוגל מדווחת על יעד יעילות מערכת ('goodput') של 97%, בעזרת ניתוב אוטומטי מחדש וטכנולוגיית Optical Circuit Switching. לפי חמין ואהדאת (Amin Vahdat), סמנכ"ל תשתית ה-AI של גוגל קלאוד, Sunfish מציג שיפור של פי 2.7 ב'תמורה לדולר' באימון לעומת Ironwood TPU v7e — נתון שממסגר את השבב לא כקפיצת ביצועים גולמית בלבד, אלא כשיפור כלכלי ישיר.

Zebrafish: שבב האינפרנס שנולד עם מדיהטק

TPU 8i, בשם קוד Zebrafish, הולך בכיוון הפוך לגמרי. במקום שני dies חישוביים, יש לו die אחד בלבד — ארכיטקטורה מכוונת לפשטות ולעלות ייצור נמוכה. הפיצוי על הפישוט מגיע בצורת מטמון SRAM ענק של 384 מגה-בייט, פי שלושה מהדור הקודם, שמאפשר גישה מהירה במיוחד לנתונים שכבר בשימוש — קריטי כשמדובר בדקודינג בזמן אמת שבו כל מילישנייה של השהיה מורגשת.

החידוש הארכיטקטוני המרכזי ב-Zebrafish הוא מנוע ה-Collectives Acceleration Engine (CAE), שמחליף ארבעה בלוקי SparseCore מהדור הקודם ותוכנן ספציפית להאצת תקשורת בין שבבים במהלך אינפרנס מבוזר. גם טופולוגיית הרשת השתנתה: במקום 3D torus, גוגל עברה לטופולוגיה בשם Boardfly, שמצמצמת את קוטר הרשת ב-56% (מ-16 קפיצות ל-7 בתצורת 1,024 שבבים) ומורידה את השהיית הפעולות המשותפות (collectives) על השבב עד פי 5. גוגל מדווחת על שיפור של פי 1.8 בביצועים לוואט לעומת Ironwood TPU v7e, עם עלות ייצור נמוכה ב-20-30% משבב האימון.

שותף עיצוב: ברודקוםTPU 8t — Sunfishאימון · 216GB HBM3e · פי 2.7 תמורה-לדולר
שותף עיצוב: מדיהטקTPU 8i — Zebrafishאינפרנס · 384MB SRAM · פי 1.8 ביצועים-לוואט

למה בכלל לפצל? ההיגיון מאחורי ההחלטה

השאלה המתבקשת היא למה גוגל בכלל מוותרת על יתרון הגמישות של שבב אחיד. התשובה הרשמית של גוגל: 'טופולוגיה אחת לא יכולה לשרת ביעילות גם אימון צפוף וגם דקודינג בסגנון נחיל-סוכנים.' זו קביעה משמעותית, כי היא מניחה שהעתיד הקרוב של עומסי AI לא נשלט על ידי אימון מודלים ענקיים בלבד, אלא יותר ויותר על ידי מערכי סוכנים אוטונומיים מרובים שמריצים אינפרנס במקביל, כל אחד עם הקשר שיחה משלו — עומס שדורש פרופיל זיכרון ורשת שונה לחלוטין מאימון.

ההקשר: Ironwood כבר כאן, הדור הבא רחוק יותר ממה שנראה

חשוב להבהיר תזמון: הדור השביעי, Ironwood, כבר הגיע לזמינות כללית (הוכרז בנובמבר 2025, עם גלגול בפועל בתחילת 2026), ומציע שיפור פי 10 בביצועי שיא לעומת TPU v5p ופי 4 בביצועים לכל שבב לעומת TPU v6e (Trillium). סופר-פוד בודד של Ironwood תומך בעד 9,216 שבבים המספקים יחד 42.5 אקסהפלופס FP8, עם 1.77 פטה-בייט זיכרון HBM משותף. אנתרופיק, שמתכננת גישה לעד מיליון TPU, כבר תיארה את Ironwood ככלי לסייע לה 'להתרחב ביעילות תוך שמירה על המהירות והאמינות שהלקוחות שלנו מצפים להן', לדברי ג'יימס ברדבורי, ראש תחום החישוב של החברה.

לעומת זאת, TPU 8t ו-8i — שני השבבים שפוצלו — מיועדים רק לסוף 2027, על תהליך 2 ננומטר של TSMC. כלומר, הפיצול הוא תכנון אסטרטגי ארוך טווח, לא שינוי שיורגש כבר השנה. הלקוח שכבר מוזכר כעוגן לדורות החדשים הוא אנתרופיק, שהרחיבה את עסקת הרכש שלה עם גוגל עד 3.5 גיגה-וואט חישוב לשנת 2027 — נתון שממחיש עד כמה גדולות ההתחייבויות ארוכות הטווח בענף הזה.

בינתיים, Ironwood הוא זה שצריך לשאת את העומס בפועל. הדור השביעי בנוי סביב קירור נוזלי, נסמך על זמינות רשת של כמעט 99.999% שגוגל שומרת בצי ה-TPU שלה החל מ-2020, ומשתמש בטכנולוגיית Optical Circuit Switching כדי לנתב תעבורה מחדש באופן דינמי סביב תקלות חומרה — מנגנון קריטי כשמדובר בסופר-פוד של 9,216 שבבים שרצים כמקשה אחת. גוגל מציגה את Ironwood כדור ה-TPU היעיל ביותר אנרגטית עד כה, וחלק מהותי מהחבילה הרחבה יותר שהיא מכנה AI Hypercomputer — צירוף של חומרה, רשת ותוכנה שלפי דוח IDC שגוגל מצטטת, מניב ללקוחות תשואה ממוצעת של 353% על פני שלוש שנים.

גוגל מול אמזון: שתי אסטרטגיות מנוגדות

הבחירה של גוגל בפיצול מלא עומדת בניגוד ישיר לאסטרטגיה שאמזון בחרה עבור משפחת Trainium שלה. AWS דוחפת לכיוון התכנסות (convergence) — שבב Trainium3 יחיד שאמור לשרת גם אימון וגם אינפרנס ביעילות סבירה, מתוך הנחה שגמישות תפעולית ופשטות בניהול הצי שווה יותר מהתמחות מקסימלית בכל צד. גוגל מהמרת על ההפך: שהפער בין הצרכים של אימון לבין הצרכים של אינפרנס אג'נטי גדול מספיק כדי להצדיק שני קווי ייצור נפרדים, שני שותפי עיצוב שונים, ושתי שרשראות אספקה נבדלות.

שתי המשפחות — 8t ו-8i — יריצו על אותם מעבדי Axion מבוססי Arm, עם תמיכה ב-PyTorch (כולל TorchTPU בגרסת תצוגה מקדימה), JAX, vLLM ו-SGLang, ובגישת bare-metal שמפחיתה תלות במסגרת עבודה מסוימת. זו נקודה חשובה: גם אם החומרה מתפצלת, גוגל שומרת על שכבת תוכנה משותפת שמנסה למנוע מהמפתחים להרגיש את הפיצול הזה בפועל.

Axion: החלק הפחות זוהר שגם הוא משתדרג

לצד ה-TPU, גוגל ממשיכה גם להרחיב את משפחת המעבדים הכלליים מבוססי Arm שלה, Axion. מכונת ה-N4A החדשה, שנמצאת כרגע בתצוגה מקדימה, מציעה עד 64 vCPU ו-512GB זיכרון DDR5, עם יחס מחיר-ביצועים טוב פי 2 מ-VM מבוסס x86 מקביל — ולקוחות כמו Vimeo כבר מדווחים על שיפור של 30% בקידוד וידאו, ו-ZoomInfo על שיפור של 60% ביחס מחיר-ביצועים בעומסי Java. C4A, שכבר זמין באופן כללי, מציע עד 72 vCPU ו-576GB זיכרון עם רשת של 100Gbps, ובקרוב תצטרף אליו גם גרסת bare-metal בשם C4A Metal. חשוב להבין את התפקיד: Axion לא מתחרה עם ה-TPU על עומסי AI כבדים, אלא משרת את כל השכבה 'המשעממת' סביבם — מיקרו-שירותים, עיבוד נתונים ואחסון — באותה פילוסופיית יעילות-לוואט שמנחה גם את פיצול ה-TPU.

השאלה שתישאר פתוחה עד סוף 2027 היא אם ההימור על התמחות מלאה בציר ה-TPU באמת ייתן יתרון תחרותי מספק כדי להצדיק את המורכבות התפעולית של ניהול שתי משפחות שבבים נפרדות במקום אחת.

מקורות

נקודות עיקריות

  • TPU 8t (Sunfish) עוצב עם ברודקום ומיועד לאימון: שני dies חישוביים, 216GB זיכרון HBM3e בקצב 6,528 GB/s, ועד 12.6 פטהפלופס FP4 בשיא
  • TPU 8i (Zebrafish) עוצב עם מדיהטק ומיועד לאינפרנס: die חישובי בודד, מטמון SRAM של 384MB (פי 3 מהדור הקודם), ועלות ייצור נמוכה ב-20-30% משבב האימון
  • גוגל מדווחת על שיפור של פי 2.7 ב'תמורה לדולר' באימון לעומת Ironwood TPU v7e, ופי 1.8 בביצועים לוואט באינפרנס
  • שני השבבים ייוצרו על תהליך 2 ננומטר של TSMC, בתצורה שונה: 8t עם שישה מחסני HBM3e לכל צד, 8i עם שישה מחסני HBM3e בסך הכול
  • תזמון: שני הדורות מיועדים לסוף 2027 — לא 2026 — מה שהופך את ה-Ironwood (דור שביעי) לעמוד השדרה של הצי בשנה הקרובה
  • אנתרופיק כבר הרחיבה עסקת רכש עד 3.5 גיגה-וואט חישוב לשנת 2027 והופכת ללקוח העוגן של שני הדורות החדשים
  • האסטרטגיה מנוגדת לזו של AWS, שבחרה בגישת התכנסות (convergence) עם Trainium3 — שבב אחד שמשרת גם אימון וגם אינפרנס

שאלות נפוצות

מה זה TPU 8t ו-TPU 8i?

שני שבבי הדור השמיני של ה-TPU של גוגל, שהוצגו לראשונה ב-Google Cloud Next באפריל 2026. 8t (שם קוד Sunfish) מיועד לאימון מודלים ועוצב עם ברודקום. 8i (שם קוד Zebrafish) מיועד לאינפרנס ועוצב עם מדיהטק — בפעם הראשונה גוגל מפצלת את משפחת ה-TPU לשני שבבים נפרדים במקום שבב אחיד.

למה גוגל מפצלת את ה-TPU לשני שבבים נפרדים?

לפי גוגל, טופולוגיית רשת ותצורת זיכרון אחת לא יכולה לשרת ביעילות גם אימון מודלים צפוף וגם דקודינג בסגנון 'נחיל סוכנים' (agent-swarm) שדורש פרופיל שונה לגמרי. הפיצול מאפשר לכל שבב להתמחות בדיוק בעומס שלו.

מתי TPU 8t ו-8i יגיעו לזמינות כללית?

שני השבבים מיוצרים בתהליך 2 ננומטר של TSMC ומיועדים לסוף 2027 — כשנה וחצי אחרי ההכרזה הראשונית באפריל 2026.

מה ההבדל בביצועים בין שני השבבים?

8t (אימון) מציג שיפור של פי 2.7 בתמורה לדולר לעומת Ironwood TPU v7e. 8i (אינפרנס) מציג שיפור של פי 1.8 בביצועים לוואט, עם עלות ייצור נמוכה ב-20-30% משבב האימון, בזכות ארכיטקטורה פשוטה יותר עם die חישובי בודד.

איך זה שונה מגישת AWS?

אמזון בחרה בגישת התכנסות (convergence) עם משפחת Trainium3 שלה — שבב אחד שמשרת גם אימון וגם אינפרנס. גוגל הולכת בכיוון ההפוך: פיצול מלא לשני שבבים ייעודיים, מהמרת על כך שהתמחות עדיפה על גמישות כוללת.