[ analysis · 06.07.2026 ]
במסגרת הקונספט שאני ממש מחבב : חינם זה הכי טוב
תכירו עוד מודל - hy3

חינם דרך api עד ה 21/07
מתחרה במודלים עם פי כמה וכמה פרמטרים ממנו.
🎉 Free through July 21.
Built for real-world business scenarios, Hy3 delivers:
🧠 295B MoE (21B active)
📚 Native 256K context
⚙️ Three configurable reasoning modes
💻 Strong coding, reasoning & long-context capabilities
🤖 Optimized for agentic workflows
Designed for productivity and real-world AI workflows, balancing reliability, efficiency, and cost at production scale.
https://openrouter.ai/tencent/hy3:free
אם ממש מסקרן אתכם ביקשתי מבינה מלאכותית חמודה לספר עליו פה :
המודל Hy3 של טנסנט הוא אחד הדגמים המתקדמים ביותר שיצאו לאחרונה בתחום הבינה המלאכותית, והוא מייצג קפיצה משמעותית ביעילות ובביצועים. מדובר במודל Mixture-of-Experts (MoE) עם 295 מיליארד פרמטרים בסך הכל, אך רק כ-21 מיליארד פרמטרים פעילים בכל העברה קדימה. זה מאפשר לו להציע ביצועים של מודלים גדולים בהרבה (אפילו טריליון פרמטרים) בעלות חישובית נמוכה בהרבה. המודל כולל גם שכבת MTP (Multi-Token Prediction) של 3.8 מיליארד פרמטרים לשיפור מהירות הדור, תומך בחלון הקשר של עד 256K טוקנים, ומשתמש בארכיטקטורה היברידית של “חשיבה מהירה ואיטית”. Hy3 פותח על ידי צוות Hunyuan של טנסנט לאחר בנייה מחדש של התשתית לאימון, והוא זמין בקוד פתוח תחת רישיון Apache 2.0, מה שהופך אותו לנגיש מאוד למפתחים ולחברות. huggingface.co
אחד היתרונות הבולטים של Hy3 הוא הביצועים הגבוהים במשימות סוכנים (agentic), קידוד והיגיון מורכב. במודל זה שולבו שיפורים משמעותיים באימון RL (Reinforcement Learning) ובנתונים איכותיים יותר, מה שהוביל לעלייה דרמטית בבנצ’מרקים כמו SWE-Bench Verified (כ-78% בפוסט-פריוויו), BrowseComp, Terminal Bench ועוד. הוא מתחרה במודלים גדולים כמו Claude Opus או GPT-5.5 בתחומים אלה, תוך שמירה על עלויות נמוכות. בנוסף, המודל מצטיין בהפחתת הזיות (hallucinations) – מ-12.5% ל-5.4% – ובשיפור יציבות בקריאות כלים, שמירה על הקשר ארוך טווח ומעקב אחר כוונות מרובות. זה הופך אותו למתאים במיוחד ליישומים פרודוקטיביים כמו פיתוח תוכנה, ניתוח נתונים ועבודה משרדית. huggingface.co
מבחינה טכנית, Hy3 כולל 80 שכבות טרנספורמר, 192 מומחים (experts) עם top-8 activation, hidden size של 4096 ו-vocabulary גדול של כ-120K. הוא תומך בדיוק BF16, ניתן להריץ על 8 GPU מתקדמים כמו H200 או H20, ויש תמיכה מובנית ב-vLLM ו-SGLang עם speculative decoding לשיפור מהירות. טנסנט סיפקה גם גרסת FP8 מקוונת להפחתת דרישות זיכרון. המודל מאפשר מצבי reasoning שונים (no_think, low, high) להתאמה בין מהירות לעומק, מה שהופך אותו לגמיש מאוד לשימושים שונים – מחשיבה ישירה ועד chain-of-thought מורכב. h