מודל מקומי שנבנה עבור עבודה מתמשכת
Meta ו־Unsloth מציגות את Muse Glimmer כמודל מולטימודלי open-weight עם כ־30 מיליארד פרמטרים, רישיון Apache 2.0 ותמיכה בגרסאות quantized להפעלה על חומרה צרכנית.
הכיוון המעניין כאן אינו רק גודל המודל. Muse Glimmer מיועד ל־agentic workflows שבהם המודל צריך לתכנן משימה, להפעיל כלים, לקבל תוצאה, להתמודד עם כשל ולהמשיך מאותה נקודה.
מה אפשר להריץ מקומית?
המודל זמין בגרסאות GGUF ובגרסאות נוספות להפעלה מקומית. דרישות הזיכרון תלויות ב־quantization, ב־context window, ב־KV cache ובחלוקת העבודה בין RAM ל־VRAM.
לפי מדריך Unsloth, גרסאות שונות נעות בערך מ־18GB זיכרון כולל ועד 24–32GB ומעלה. לכן “רץ על 24GB” אינו אומר שכל גרסת 30B תעבוד באותה צורה על כל כרטיס.
מה מיוחד ב־agent workflow?
במקום להחזיר תשובה אחת ולסיים, המודל יכול להשתלב בתהליך ארוך יותר: לתכנן, להפעיל כלים, לבדוק תוצאה, לתקן כיוון ולהמשיך. התמדה מלאה תלויה גם ב־harness, בזיכרון runtime ובהרשאות שהמערכת נותנת ל־agent.
זה משנה את נקודת ההשוואה. לא רק מודל ענן חזק מול מודל מקומי זול, אלא מודלים שמחזירים תשובות מול מודלים שמתאימים יותר לעבודה רציפה על משימה.

