תפסיקו לשדרג את המודל ותתחילו להנדס את הרתמה

תפסיקו לשדרג את המודל ותתחילו להנדס את הרתמה
המרדף אחרי המודל החזק ביותר הוא הסחת דעת יקרה. אם סוכן ה-AI שלכם נכשל במשימות ארוכות טווח, הבעיה היא כנראה לא ב-IQ של מודל השפה, אלא בתשתית שעוטפת אותו.
נקודות מרכזיות
- אשליית המודל החכם: שיפורים ב"רתמת הסוכן" (Agent Harness) משפיעים על הביצועים יותר מאשר מעבר בין מודלים מובילים.
- תזמור MEA: הפרדה בין ניהול (Manage), ביצוע (Execute) וביקורת (Audit) היא המפתח לאמינות במערכות ייצור.
- משילות הקשר: ניהול זיכרון ואימות עובדות חיצוני מונעים את הדרדרות הביצועים שמתרחשת לאורך זמן.
למה מודל חזק יותר לא יציל אתכם
בכל פעם שסוכן AI שבנינו ב-Aniccai התחיל "להזות" או להיתקע בלולאות אינסופיות, האינסטינקט הראשון שלנו היה להחליף את המודל. עברנו מ-GPT-4 ל-Claude 3.5, ואז לגרסאות מתקדמות יותר, וחיכינו לקסם.
זה לא קרה.
הסיבה לכך היא מה שחוקרים מכנים "תזת האילוץ המקשר" (Binding Constraint Thesis). ברגע שהגעתם לסף מסוים של יכולת חשיבה, ביצועי הסוכן נקבעים על ידי ה-Harness, הרתמה. הרתמה היא שכבת התשתית שמנהלת את בניית ההקשר, האינטראקציה עם הכלים, הזיכרון והאימות.
מחקר של אוניברסיטת ברקלי על Scaling the Harness מראה ששינויים קטנים בארכיטקטורת המערכת יכולים להניב שיפורים גדולים יותר מאשר החלפת המודל עצמו. אנחנו משקיעים הון בטוקנים של מודלי Frontier, כשבפועל הבעיה היא בצינורות שדרכם המידע זורם.
מהי בעצם רתמת סוכן (Agent Harness)?
הרתמה היא לא רק ה-Prompt. היא מערכת ההפעלה של הסוכן. היא כוללת:
- מנהל הקשר: מחליט איזה מידע נכנס לחלון ההקשר ואיזה נשאר בחוץ כדי למנוע "ריקבון הקשר".
- מנגנון שליטה: הלוגיקה שמחליטה מתי להפעיל כלי חיצוני ומתי לעצור.
- שכבת אימות: בודק עצמאי שמוודא שהפעולה שהסוכן ביצע אכן קרתה במציאות.
בלי רתמה מהונדסת היטב, המודל הכי חכם בעולם הוא כמו נהג מרוצים מיומן שיושב במכונית בלי הגה ובלי בלמים.
מודל ה-MEA: ניהול, ביצוע, ביקורת
אחת הטעויות הנפוצות היא לתת לאותו מודל באותו חלון הקשר גם לתכנן, גם לבצע וגם לבקר את עצמו. זה מתכון בטוח לטעות מצטברת. המסגרת של LongHorizon-Harness מציעה פיצול תפקידים חד:
- Manager (מנהל): מחזיק את מצב המשימה הכולל ומגדיר את תת-המשימה הבאה. אין לו גישה ישירה לכלים.
- Executor (מבצע): מקבל משימה מוגדרת היטב, מבצע אותה בחלון הקשר נקי, ונסגר.
- Auditor (מבקר): בודק את הסביבה, למשל, האם הקובץ באמת נוצר? ומדווח למנהל.
הפרדה זו מונעת מהסוכן לשכנע את עצמו שהוא הצליח כשבפועל הוא נכשל. זהו מעבר מלולאות סטוכסטיות למעברי מצב מבוקרים.
השוואת ביצועים: מודל מול רתמה
| גורם משפיע | השפעה על משימות קצרות | השפעה על משימות ארוכות (Long-Horizon) |
|---|---|---|
| שדרוג מודל (למשל מ-Pro ל-Ultra) | גבוהה מאוד | בינונית-נמוכה |
| אופטימיזציה של הרתמה (Harness) | נמוכה | קריטית |
| ניהול זיכרון ואימות חיצוני | זניחה | מכרעת |
איך מתחילים להנדס את הרתמה שלכם?
אל תחכו למודל הבא של OpenAI או Anthropic שיפתור לכם את בעיות האמינות. התחילו למדוד את ה-Harness שלכם.
השתמשו בכלים כמו Harness-Bench כדי לאבחן איפה הסוכן שלכם מאבד את הצפון. האם זה בגלל שההקשר שלו עמוס מדי? האם הוא לא מקבל פידבק נכון מהכלים?
הנדסת רתמה היא עבודה פחות "סקסית" מכתיבת פרומפטים יצירתיים, אבל היא ההבדל בין דמו מרשים לבין מערכת שעובדת בייצור ביום ראשון בבוקר בלי השגחה.
מקורות
- Stop Comparing LLM Agents Without Disclosing the Harness (OpenReview)
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows (Robotics Center)
- From Model Scaling to System Scaling: Scaling the Harness in Agentic AI (alphaXiv)
- LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks (arXiv)
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization (Scale Labs)
שאלות נפוצות
מה זה בעצם Agent Harness?
זוהי שכבת התוכנה והלוגיקה שעוטפת את מודל השפה. היא מנהלת את הגישה לכלים, את הזיכרון לטווח קצר וארוך, ואת האופן שבו המודל מקבל משוב מהסביבה.
למה שדרוג המודל לא תמיד עוזר?
כי במשימות מורכבות, הכשל הוא לרוב ניהולי, איבוד ריכוז בגלל הקשר ארוך מדי או חוסר יכולת לאמת ביצוע. מודל חכם יותר פשוט יטעה בצורה רהוטה יותר אם התשתית סביבו לקויה.
מהו מנגנון ה-MEA?
זוהי שיטת עבודה המחלקת את הסוכן לשלושה תפקידים נפרדים: מנהל (Manager) שמתכנן, מבצע (Executor) שעושה את העבודה, ומבקר (Auditor) שמוודא שהתוצאה תקינה.
דברים שחשוב לזכור
- הרתמה (Harness) קובעת את תקרת הביצועים של הסוכן במשימות ארוכות.
- הפרדת רשויות בין תכנון, ביצוע וביקורת מונעת טעויות מצטברות.
- אל תשקיעו במודלים יקרים לפני שווידאתם שהתשתית שלכם מסוגלת לנהל את המידע שהם מייצרים.
מהי הנקודה שבה הסוכן שלכם בדרך כלל "מאבד את זה", האם זה אחרי 5 שלבים או 50? בדקו את חלון ההקשר שלכם בנקודה הזו.
מתלבטים לגבי החלטה ב-AI או בתפעול?
דברו עם הצוות. שיחה אחת, צעד אחד ברור קדימה.
שליחת הודעה ב-WhatsAppמאמרים קשורים
כל המאמרים באסטרטגית AI
מפרומפטים חולפים למיומנויות קבועות: עתיד ה-AI בארגון
גלו מדוע אסטרטגיית AI מנצחת מתמקדת בקידוד מיומנויות ולא בפרומפטים חולפים. למדו איך לבנות תהליכי עבודה אוטונומיים שצומחים עם הארגון שלכם.

מעבר לפרומפט: ניהול צוותי סוכנים ככוח עבודה
גלו כיצד צוותי סוכנים אוטונומיים כמו Kiro Crew משנים את חוקי המשחק ב-DevOps על ידי טיפול ב'דליפות שקטות' ותחזוקה שוטפת ללא התערבות אנושית.

חוק ה-98.4%: למה AI בייצור הוא בעיקר אתגר הנדסי
מדוע 98.4% מבינה מלאכותית בייצור היא תשתית ולא אינטליגנציה. גלו כיצד ה-Agent Harness של מיקרוסופט משנה את כללי המשחק עבור עסקים.