מדד WANDR והמיתוס של סוכן המחקר פי 10

ר
רועי סעדון
28 ביולי 2026
12 דקות קריאה
מדד WANDR והמיתוס של סוכן המחקר פי 10

מהו מדד WANDR וכיצד הוא משנה את הערכת סוכני ה-AI?

מדד WANDR (ראשי תיבות של Wide ANd Deep Research) הוא כלי הערכה בקוד פתוח שפורסם על ידי Perplexity ביולי 2026. הוא נועד לבחון את היכולת של סוכני מחקר לבצע משימות איסוף נתונים רחבות ומעמיקות בו-זמנית, תוך דרישה להוכחות מבוססות מקור לכל פריט מידע.

ההבטחה של ⁨סוכני מחקר אוטונומיים⁩ נתקלת כעת במציאות קרה. בעוד שהנרטיב השיווקי מציג עולם שבו בינה מלאכותית מחליפה אנליסטים ב⁨בדיקות נאותות (Due Diligence)⁩ ומחקרי שוק, הנתונים מראים אחרת. השקת מדד WANDR של Perplexity חושפת פער מדאיג: אפילו המערכות המתקדמות ביותר נכשלות ב-87% מהמשימות המורכבות הדורשות אימות ראיות בקנה מידה רחב.

נקודות מרכזיות

  • קריסת האמינות בקנה מידה רחב: ככל שמשימת המחקר גדלה, רמת הדיוק של הסוכנים צונחת באופן דרסטי.
  • הפער בין מציאה להוכחה: מציאת קישור היא קלה; חילוץ ציטוט מדויק שמוכיח טענה ספציפית הוא המקום שבו רוב המערכות נכשלות.
  • ציון F1 נמוך: המערכת המובילה (Search as Code) השיגה ציון של 0.133 בלבד במדד ה-Hard F1 המחמיר.
  • עלות מול תועלת: מחקר מעמיק דורש משאבים עצומים, כאשר עלות משימה בודדת יכולה להגיע למאות דולרים ללא הבטחת דיוק.

הבעיה של 'רחב ועמוק': מדוע סוכנים נכשלים בבדיקות נאותות

רוב המדדים הקיימים בוחנים האם מודל יכול לענות על שאלה אחת נכונה. WANDR שואל משהו קשה בהרבה: האם הסוכן יכול למצוא את כל 70 החברות שעומדות בקריטריון מסוים, לאמת עובדה ספציפית לגבי כל אחת מהן, ולצטט עמוד שבאמת מוכיח זאת?

כאן נכנס המושג של היררכיית מפתחות. משימה טיפוסית דורשת מהסוכן לעבור דרך עץ החלטות: חברה -> עובד -> קישור הוכחה. אם ענף אחד נשבר, כל הרשומה נחשבת לפסולה. לפי הניתוח של AlphaSignal, המבנה הזה מעניש סוכנים על חוסר עקביות, מה שמוביל לציונים נמוכים משמעותית ממה שהורגלנו לראות במבחני צ'אט רגילים.

השוואת ביצועים: סוכני מחקר מובילים (יולי 2026)

מערכתציון Soft F1 (התקדמות חלקית)ציון Hard F1 (השלמה מלאה)עלות חציונית למשימה
Perplexity SaC0.3630.133$5.20
Anthropic0.2490.072גבוהה משמעותית
OpenAI0.1210.035נמוכה
Exa / Parallel0.1210.035משתנה

הנתונים מראים שגם המנצחת, Perplexity, רחוקה מפתרון הבעיה. ציון של 0.133 אומר שהמערכת קיבלה קרדיט מלא רק על אחת מתוך שבע רשומות שנדרשו.

מס קנה המידה: כיצד גילוי רחב מוביל ל⁨הזיות עמוקות

אחד הממצאים המרתקים ב-דיווח של AI Insiders הוא שקנה המידה פועל כרעל עבור סוכני AI. במשימות קטנות, הדיוק סביר. אך ברגע שהסוכן נדרש לאסוף מאות רשומות, מתרחשת 'ריקבון הקשר'. הסוכן מתחיל 'לחפף' באימות הראיות כדי לעמוד במכסת הכמות.

הבעיה אינה במציאת הדף הנכון. הנתונים מראים שרק אחוז קטן מהדפים אינם שמישים. הכישלון האמיתי (בין 57% ל-86%) הוא בחילוץ הציטוט (Excerpt) שתומך בטענה. הסוכן מגיש קישור רלוונטי, אך המידע בתוך הקישור לא באמת מוכיח את מה שהסוכן טוען שהוא מוכיח.

כיצד לבנות מערכות שעוקפות את מגבלות הסוכנים

עבור ארגונים, המסקנה אינה להפסיק להשתמש ב-AI, אלא לשנות את צורת העבודה. במקום להסתמך על סוכן שיגיש דוח סופי, יש לבנות ⁨מערכות 'אדם בלולאה'⁩ (Human-in-the-loop).

  1. הגדרת קריטריוני עצירה: אל תתנו לסוכן לרוץ עד אינסוף. הגדירו נקודות ביקורת שבהן אדם מאמת את איכות הראיות הראשונות.
  2. אימות צלבי: השתמשו בסוכן אחד למחקר ובסוכן שני, עם מודל שונה, לביקורת על הציטוטים שהובאו.
  3. פירוק משימות: במקום לבקש 'מפת מתחרים מלאה', פרקו את המשימה לתתי-משימות קטנות שבהן הסוכן פחות נוטה לאבד ריכוז.

העתיד של מחקר ה-AI אינו סוכן קסום שעושה הכל, אלא תשתית שבה כל פיסת מידע ניתנת לאימות מיידי על ידי המשתמש. כפי שמציין הבלוג של explainx.ai, המדד הזה הוא קריאת השכמה לכל מי שחשב שניתן להחליף אנליסטים אנושיים בלחיצת כפתור.

מקורות

מה ההבדל בין ציון Soft F1 ל-Hard F1 במחקר AI?

ציון Soft F1 מעניק קרדיט חלקי על הצלחה חלקית במשימה, כמו מציאת החברה הנכונה אך ללא הוכחה מספקת. ציון Hard F1 דורש שכל עץ המידע יהיה מושלם ומגובה בראיות כדי לקבל נקודות.

האם סוכני AI יכולים לבצע בדיקות נאותות (Due Diligence) באופן עצמאי?

לפי מדד WANDR, התשובה היא כרגע לא. הסוכנים נכשלים ברוב המשימות המורכבות ודורשים פיקוח אנושי הדוק כדי להבטיח שהמקורות המצוטטים אכן תומכים בטענות העובדתיות.

מדוע סוכני מחקר הופכים לפחות אמינים ככל שהמשימה גדולה יותר?

תופעה זו מכונה 'ריקבון הקשר'. ככל שהסוכן מעבד יותר נתונים ומבצע יותר פעולות חיפוש, גדל הסיכוי לטעויות מצטברות, כפילויות ואיבוד היכולת לאמת כל פרט מול המקור המקורי.

3 דברים שחשוב לזכור

  • מחקר AI נוכחי מצטיין במציאת קצוות חוט אך נכשל באימות שיטתי של נתונים בקנה מידה רחב.
  • הפער בין 'נראה נכון' לבין 'מוכח על ידי המקור' הוא המכשול הגדול ביותר של סוכני המחקר ב-2026.
  • אל תסתמכו על סיכומי AI ללא גישה ישירה לציטוטים המקוריים ואימות ידני של מדגמים מהדוח.

מתלבטים לגבי החלטה ב-AI או בתפעול?

דברו עם הצוות. שיחה אחת, צעד אחד ברור קדימה.

שליחת הודעה ב-WhatsApp

מאמרים קשורים

כל המאמרים בסוכני AI