[ analysis · 11.12.2025 ]
5V)
הדגם הקודם, GLM-4.5V (ששוחרר באוגוסט 2025), כבר היה חזק מאוד בהבנת תמונות וסרטונים, עם ביצועים מצוינים ב-42 מבחנים ויזואליים ויכולות כמו חשיבה צעד-אחר-צעד (Chain-of-Thought). אבל GLM-4.6V מביא שיפורים משמעותיים שמקדמים אותו צעד קדימה, בעיקר בתחום הסוכנים האוטומטיים והשימוש בכלים:

- הרחבת חלון הקונטקסט: עכשיו 128,000 טוקנים (לעומת 128K בדגם הקודם, אבל עם אימון טוב יותר על נתונים ארוכים), מה שמאפשר עיבוד סרטונים ארוכים יותר (עד שעה) או מסמכים של 150 עמודים בבת אחת, בלי איבוד מידע.
- קריאה טבעית לפונקציות ויזואליות (Native Function Calling): זה החידוש הגדול ביותר – בדגם הקודם, הסוכנים היו צריכים להמיר תמונות לטקסט קודם (מה שגורם לאיבוד מידע ועיכובים), אבל עכשיו המודל מעביר נתונים ויזואליים ישירות לכלים חיצוניים, כמו חיפוש באינטרנט או יצירת גרפים. זה מקצר את התהליך ומשפר את הדיוק ב-15% במשימות סוכנים.
- שיפור בביצועים ספציפיים: במבחן MathVista (מתמטיקה ויזואלית) – 88.2% לעומת 84.6%; ב-WebVoyager (סוכנים בגלישה) – 81.0% לעומת 68.4% במודלים דומים; וב-Ref-L4-test (הבנת התייחסויות בתמונות) – 88.9% עם דיוק גבוה יותר בהקשרים (grounding fidelity). בסך הכול, שיפור של 5-10% במשימות מורכבות כמו בניית קוד או ניתוח נתונים.
- אופטימיזציה לסוכנים: הדגם החדש מתמקד יותר ב"פעולה" מאשר רק "חשיבה" – הוא יכול לשלב תוצאות מכלים (כמו תמונות מחיפוש) ישירות לתהליך ההיגיון, מה שהופך אותו למתאים יותר לאפליקציות עסקיות כמו חיפוש ויזואלי או יצירת דוחות
אוטומטיים.
בקיצור, GLM-4.6V הופך את הדגם הקודם ממשהו ש"מבין" תמונות למשהו ש"פועל" עליהן, עם פחות טעויות ומהירות גבוהה יותר.
#### קישורים רשמיים וחשובים
- הפוסט הרשמי ב-X (טוויטר):
- הבלוג הטכני המלא (עם טבלאות וגרפים):
- דף HuggingFace של הדגמים:
– GLM-4.6V-Flash-9B:
– GLM-4.6V-Plus-106B:
- GitHub רשמי עם דוגמאות קוד והרצה:
- דוגמאות אונליין (דרך ChatGLM.cn):