Qwen פרסמה את Qwen-MM-Plugins, פרויקט שמציג גישה מודולרית ליכולות מולטימודליות של סוכני AI.
במקום לחבר agent למודל מולטימודלי אחד שמנסה לבצע את כל המשימות, הפרויקט מפריד את היכולות לשכבת כלים שאפשר לגלות ולהפעיל לפי הצורך.
מה כולל ה-tool layer?
ב־core capability של הפרויקט מופיעים כלים לקריאת תמונות, וידאו, מסמכים ומודלים תלת־ממדיים, לצד OCR, זיהוי ומיקום אובייקטים, segmentation, תמלול אודיו ו־vision chat. יכולות נוספות מיועדות לזיכרון וידאו ארוך, עריכת וידאו, יצירת מדיה ועבודה עם Blender או FreeCAD.
כל capability מותקן בנפרד וכולל skill שמסביר ל-agent אילו כלים זמינים, ובמקרים הרלוונטיים גם שרת MCP שמספק את הכלים עצמם.
איך נראה workflow כזה?
Agent יכול לקרוא תמונה, לזהות אובייקט, לחתוך אזור, להריץ עליו OCR, להשוות את התוצאה לפריים מתוך וידאו, לתמלל את האודיו ולחבר את הממצאים לתשובה אחת.
הנקודה החשובה היא שה-agent לא חייב להיות תלוי ביכולת סגורה של מודל יחיד. הוא מקבל אוסף capabilities שניתן להחליף, להרחיב ולשלב בתוך harness כמו Claude Code, Codex, Qwen Code ו־Gemini CLI.
מה עדיין דורש פתרון?
מודולריות לא פותרת אוטומטית את בעיות האמינות. צריך להחליט איזה כלי להפעיל, לבדוק את התוצאה, לנהל הרשאות ולהגדיר מתי ה-agent חייב לעצור ולבקש אישור.
לכן השאלה המרכזית משתנה: פחות “איזה מודל יודע לעשות הכול?”, ויותר “איזה כלים ה-agent יודע לבחור, להפעיל ולשרשר בצורה בטוחה?”
פרטים וקוד זמינים ב־מאגר הרשמי ב־GitHub.

