[ analysis · 19.02.2026 ]

טוב. מן בסתם ב20 דקות לא הספקתי לבדוק אותו אבל ביקשתי מהai לסכם לי את ההכרזה ולמה הוא מיוחד ואיך הוא מול האחרים.

מוזמנים כמובן לבצע את הבדיקה שלכם אבל זה מה שהם אומרים (עם ההערות שלי) :

ג'מיני 3.1 פרו הוא מודל בינה מלאכותית חדש מגוגל שאמור להתמודד עם בעיות חדשות ומסובכות, כאלה שדורשות חשיבה מופשטת כמו זיהוי דפוסים או ארגון מידע בצורה יצירתית.

מה שמעניין בו זה שהוא לא סתם עונה על שאלות פשוטות, אלא מצליח לפתור משימות שמזכירות חידות ויזואליות או תהליכים מורכבים, כמו לדמיין רעיונות בעזרת אנימציות.

זה הופך אותו לכלי שימושי בחיים האמיתיים, למשל במחקר, בעסקים או אפילו בחינוך, כי הוא עוזר להבין דברים מסובכים בצורה פשוטה יותר. אנשים רגילים יכולים להשתמש בו כדי לארגן נתונים או להמחיש רעיונות, בלי צורך בידע טכני עמוק.

(הערה שלי ? עד עכשיו לא ראיתי פה משהו שלא קרה קודם ….)

החידוש העיקרי לעומת הגרסה הקודמת, ג'מיני 3 פרו, הוא שיפור דרמטי בביצועים. בגרסה הקודמת, המודל קיבל רק 31% במבחן ARC-AGI-2, שזה מבחן קשה שמודד יכולת להתמודד עם בעיות לא מוכרות.

עכשיו, ג'מיני 3.1 פרו קפץ ל-77%, יותר מכפול! זה אומר שהוא למד להתאים את עצמו טוב יותר למצבים חדשים, עם שיפורים באלגוריתמים שמאפשרים חשיבה עמוקה יותר וזיהוי דפוסים מהיר. בניגוד לקודם, שנתקע לפעמים במשימות בלתי צפויות, החדש מצטיין בזרימות עבודה דינמיות, כמו יצירת הדמיות או פתרון בעיות מורכבות בצעדים לוגיים.

(ושוב הערה שלי - בואו ננסה ונראה איך הוא יתמודד. עם מה שרק אופוס פתר …)

בהשוואה למודלים אחרים, ג'מיני 3.1 פרו עולה על קלוד אופוס 4.6, שקיבל 68.8% באותו מבחן – כלומר, ג'מיני יותר טוב בהיגיון מופשט. אופוס 4.6 חזק במשימות ארוכות טווח ומשתמש במשאבים בצורה יעילה, אבל ג'מיני לוקח את ההובלה בפתרון בעיות חדשות.

לגבי קודקס 5.3, שהוא מודל ממוקד קוד מבית אופן איי איי, הוא מצטיין בביצועים קודינג כמו 77.3% במבחן טרמינל-בנץ' 2.0, אבל במבחנים כלליים כמו ARC-AGI-2, הציון שלו נמוך יותר (פחות מ-68.8%), כי הוא מתמחה יותר בפיתוח תוכנה מאשר בחשיבה ויזואלית כללית. בסופו של דבר, ג'מיני 3.1 פרו בולט כמודל רב-תכליתי יותר למשימות מגוונות.

ואני מסכם ? תנסו ותראו. בסוף לצערי אופוס 4.6 עד היום מצליח איפה שכולם נכשלו. ננסה ונראה. שיהיה אחלה ערב לכולם ל