[ release · 13.07.2026 ]

ערב טוב

אז הבוקר שוטטתי לי בטוויטר, וראיתי כמה פוסטים

ערב טוב
ערב טוב

וחשבתי לעצמי : הולי שיט (כמו שאומרים)

דיברנו לפני כמה שבועות על גירסאות של קוונטיזציה (כתבתי לכם פה קטע לא קצר על מה זה איך ולמה משתמשים בזה )

היום אני רואה פרסום בטוויטר על חבילה בקוד פתוח שמאפשרת להריץ את המודל המלא של glm 5.2 על מחשב ״נורמלי״ (יחסית. עדיין עם המון זיכרון) בלי בעיה תוך כדי שהוא טוען כל פעם רק חלק מסוים מהמודל.

אז, אני באמת משתדל אבל לא תמיד מצליח, לספר לכם על דברים אחרי שאני בודק

ואת זה, הייתי חייב לבדוק, אז התחלתי לראות פרסומים גם על כמה זה מטורף, ואמרתי, לא כותב כלום, עד שאני מנסה.

בשבועיים האחרונים אני משחק המון עם מודלים מקומיים - וזה משהו נהדר. הם יכולים פשוט לרוץ בלי הפסקה באפס שקלים על המחשב ולבצע מה שתרצו. אני ממליץ על ornith שפרסמתי פה שבוע שעבר.

אבל אם אפשר להריץ על מחשב נורמלי ולא מכונה שעולה 100,000 דולר מודל כמו glm 5.2 זה כבר משהו אחר (הבדל בין 9B,34b ו726b פרמטרים הוא אדיר בביצועים ) אז זה כבר סיפור אחר.

אז הגעתי הבייתה, הורדתי 376 גיגה, השקעתי ביצירת המנוע מהריפו

והפעלתי

וזה עובד

בערך

המחשב שלי עם 64 גיגה

המודל יושב על המחשב, 19 גיגה זיכרון מוקדשים לו

שאר הזיכרון נטען מהssd בעצם

המודל לא נטען כולו לזיכרון כמו בענן, אלא לוקח כל פעם את המומחים הרלוונטים

והמהירות? 0.2 טוקן לשניה

זה אומר שהמשפט שאתם תראו עוד שניה לקח בערך 3 דקות לכתיבה.

אפשר לשפר? כן בטח

יותר טעניה לזיכרון על חשבון הדיסק, תגדיל מהירות

הוא ילמד אותי ואיזה מומחה צריך? יגדל

ועדיין, אנחנו כנראה עוד לא שם

אבל זה סופר מעניין

ואם יהיה לכם מחשב נחמד של 128 גיגה כנראה שמצבכם יהיה יותר טוב

ובכללי, עדיין סופר מומלץ ה9b וה34b - אני עושה איתם דברים מגניבים רצח

ריפו בגיטהאב

https://github.com/JustVugg/colibri