אורי דניאלי

Evals לסוכני בינה מלאכותית (AI) הם מערך בדיקות חוזר שמודד לא רק אם התשובה נכונה, אלא אם הסוכן בחר את הכלי הנכון, פעל לפי מדיניות, שמר על הרשאות, השלים את המשימה והסלים לאדם כשצריך. לפני שמרחיבים שימוש, בונים אוסף תרחישים מעבודה אמיתית, מגדירים תוצאה רצויה וגבולות סיכון, מריצים את אותה בדיקה על כל גרסה ועוקבים גם אחרי ביצועים בייצור.

מה ההבדל בין Evals לדמו מוצלח?

דמו מראה שמערכת הצליחה פעם אחת בתרחיש שנבחר מראש. Eval בודק האם היא מצליחה באופן עקבי, באילו תנאים היא נכשלת ומה המחיר של הכישלון. בסוכן אוטונומי חשוב למדוד את כל מסלול הפעולה: הבנת מטרה, בחירת כלי, שימוש במידע, ביצוע, אימות והסלמה. הבדיקה אינה ציון כללי למודל. היא קשורה לתפקיד. סוכן שמסכם מסמכים נמדד אחרת מסוכן שמעדכן CRM, וסוכן שמכין טיוטה נמדד אחרת מסוכן שמבצע פעולה מול לקוח.

למה בדיקות רגילות אינן מספיקות?

מערכת סוכן יכולה לתת תשובה סבירה ולבצע דרך לא נכונה: לקרוא מאגר שאסור לה, להשתמש בנתון ישן, לחזור על פעולה, לדלג על אישור או להציג הצלחה כאשר השינוי לא נשמר. לכן יש למדוד גם תוצאה וגם התנהגות. NIST מרחיב ב-2026 את עבודתו על מדידה, עקיבות ותקנים לסוכנים. הכיוון ברור: הערכה של מערכות אוטונומיות דורשת תרחישים מציאותיים, ראיות שניתן לבדוק ושיטות שמבחינות בין שיפור אמיתי לרעש מקרי.

שלוש שכבות של מערך בדיקותתרחישי ליבהאספו 20 עד 50 משימות מייצגות מתוך העבודה. כל תרחיש כולל קלט, הקשר, כלים מותרים, תוצאה רצויה ותנאי עצירה. חשוב לכלול שונות טבעית בניסוח ולא רק בקשה אחת "מושלמת".

תרחישי קצה וסיכוןבדקו מידע חסר, הרשאה חסרה, הוראה סותרת, מסמך זדוני, לקוח כועס, פעולה כפולה ושינוי פתאומי בממשק. מטרת השכבה אינה להכשיל בכוח, אלא לגלות אם הסוכן יודע לעצור בבטחה.

תרחישי שינויכל עדכון במודל, בהנחיה, בכלי או במדיניות עלול לשפר משימה אחת ולפגוע באחרת. שמרו מערך רגרסיה קבוע והוסיפו אליו תקלות מהשטח. כך כל כשל הופך לבדיקה שמונעת חזרה.

אילו מדדים כדאי למדוד?

השלמת משימה: האם התוצאה העסקית הושגה בפועל?

ציות למדיניות: האם הסוכן פעל בגבולות ההרשאה והנוהל?

יעילות: כמה זמן, צעדים וכלים נדרשו להשלמה?

הסלמה נכונה: האם הסוכן עצר והעביר לאדם במצב לא ודאי או רגיש?

יכולת שחזור: האם אפשר להבין מה קרה ולתקן?

אין צורך לאחד הכול לציון אחד. לעיתים שיעור הצלחה גבוה מסתיר כשל נדיר אך חמור. עדיף להציג לוח מדדים שבו איכות, סיכון ועלות נשארים גלויים.

לולאת שיפור מפיילוט לייצורקובעים קו בסיסמריצים את מערך הבדיקות על הגרסה הראשונה ומתעדים תוצאות. קו הבסיס מאפשר להבחין בין תחושה של שיפור לבין שינוי שנמדד.

מפרידים בין תיקון להרחבהכאשר הסוכן נכשל, בודקים אם הבעיה במידע, בהרשאה, בהנחיה, בבחירת הכלי או במודל. אין להחליף מודל אוטומטית כאשר מקור הידע עצמו שגוי או שהתהליך אינו מוגדר.

מנטרים אחרי ההשקהדגמו תהליכים אמיתיים, בדקו הסלמות ופתחו מחדש מקרים חריגים. שינוי במדיניות, בלקוחות או במערכות יכול להפוך Eval ישן ללא רלוונטי. הבדיקה היא מערכת חיה, לא שער חד-פעמי.

שאלות נפוצות

1. 1. כמה תרחישים צריך להתחלה?

עדיף להתחיל בעשרות תרחישים איכותיים שמייצגים עבודה וסיכון, ולא באלפי שאלות כלליות. הרחיבו את המאגר לפי תקלות, שימושים חדשים ושונות אמיתית.

2. 2. האם אפשר להשתמש במודל כדי לדרג מודל?

אך לא לבדו. Grader מבוסס AI יכול לסייע בהיקף גדול, לצד כללים דטרמיניסטיים, בדיקות מערכת ודגימה אנושית. יש לבדוק גם את אמינות המדרג ולהגדיר מתי נדרשת הכרעה מקצועית.

3. 3. מתי סוכן מוכן לייצור?

כאשר הוא עומד ברף שנקבע לתרחישי ליבה, נכשל בבטחה בתרחישי סיכון, מתועד, ניתן לעצירה ויש בעל תפקיד שמקבל אחריות. אין רף אוניברסלי; הרף נגזר מהשפעת הפעולה.

OECD: עקרונות לשימוש אחראי בבינה מלאכותית

איך הופכים את הידע לתהליך עבודה?

יישום מקצועי של Evals לסוכני AI: איך בודקים מערכת אוטונומית לפני שמרחיבים שימוש אינו מתחיל בבחירת כלי או בהכרזה על פרויקט רחב. מתחילים בתוצאה עסקית או מקצועית שאפשר להסביר ולבדוק: החלטה שצריך לשפר, זמן טיפול שרוצים לקצר, מידע שצריך לארגן או איכות תוצר שרוצים להעלות. לאחר מכן מגדירים מי בעל התהליך, מי משתמש בתוצאה, איזה מידע מותר להזין ומה נשאר באחריות אנושית. ההגדרה הזו מונעת מצב שבו המערכת מייצרת טיוטות מרשימות, אך אין דרך לקבוע אם הן נכונות, בטוחות או מועילות. היא גם מאפשרת להשוות בין עבודה קיימת לעבודה בסיוע בינה מלאכותית על בסיס נתונים ולא על בסיס תחושה.

תוכנית יישום בשלושה שלבים

מגדירים תוצאה, גבולות ובעלות

בשלב הראשון מתארים את המשימה מתחילתה ועד סופה ומזהים את נקודות ההחלטה. קובעים אילו מקורות נחשבים מוסמכים, איזה מידע רגיש או חסוי אינו נכנס למערכת, מי רשאי לשנות את ההנחיות ומי מאשר את התוצר. כדאי לנסח גם תנאי עצירה: מידע חסר, סתירה בין מקורות, פעולה בלתי הפיכה או השפעה מהותית על אדם. כאשר הגבולות גלויים, העובדים אינם צריכים לנחש בכל שימוש מחדש מה מותר ומה אסור.

בונים תרחיש בדיקה וקו בסיס

בשלב השני בוחרים כמה מקרים אמיתיים ומייצגים, מסירים מהם מידע שאינו נחוץ ומכינים תוצאה אנושית להשוואה. מודדים את המצב הקיים: זמן עד תוצר מאושר, מספר תיקונים, טעויות חוזרות, תלות במומחה ושביעות רצון המשתמשים. את תוצרי הבינה המלאכותית בודקים באותם קריטריונים. חשוב לכלול גם מקרי קצה ותשובות שאינן ודאיות, משום שמערכת שנראית טובה בדוגמה פשוטה עלולה להיכשל דווקא במצבים שבהם נדרשת שיקול דעת.

מתרגלים, מודדים ומשפרים

בשלב השלישי עובדים במחזורים קצרים. המשתמשים מתרגלים על משימות מהעבודה, מתעדים אילו תיקונים ביצעו ומדווחים על תוצאה לא מדויקת, חריגה מהרשאה או קושי בהסבר. אחת לתקופה בוחנים אם ההנחיות, המקורות וההרשאות עדיין מתאימים. הרחבה לצוותים נוספים מתבצעת רק לאחר שהאיכות יציבה, האחריות ברורה וקיימת דרך לטפל בחריגים. כך ההטמעה הופכת ללמידה ארגונית ולא לאוסף שימושים פרטיים שאיש אינו מנהל.

איך בוחנים איכות ולא רק מהירות?

זמן עד טיוטה ראשונה הוא מדד חלקי בלבד. המדד החשוב יותר הוא זמן עד תוצר מאושר, לצד דיוק, שלמות, התאמה לקהל ושיעור התיקונים שנדרשו. יש למדוד גם סיכון: חשיפת מידע, המצאת עובדות, שימוש במקור לא עדכני, החלטה ללא הסבר או פעולה שבוצעה בלי אישור. לכל מדד יעילות מומלץ להצמיד מדד איכות אחד לפחות. אם המערכת חוסכת דקות אך מעבירה את העומס לבדיקת מומחה, ייתכן שלא נוצר שיפור אמיתי.

מה תפקיד המנהלים בתהליך?

המנהל אינו צריך לכתוב כל הנחיה בעצמו, אך עליו להגדיר את התוצאה, את גבולות הסיכון ואת חלוקת האחריות. עליו לאפשר זמן לתרגול, לבקש דוגמאות של הצלחות וכישלונות ולוודא שהעובדים יודעים מתי לעצור ולהתייעץ. בתהליכים רגישים משלבים לפי הצורך אבטחת מידע, פרטיות, ייעוץ משפטי, משאבי אנוש ומערכות מידע. ניהול נכון יוצר שפה משותפת: מה נחשב שימוש מועיל, כיצד בודקים תוצאה ומי מוסמך לאשר מעבר מניסוי לשגרה.

מקורות והמשך קריאה

להעמקה, למידה ותרגול מעשי

רוצים להפוך את הידע ליכולת עבודה מעשית? אפשר להעמיק באמצעות סדנת בינה מלאכותית לארגונים, לבחור הרצאת בינה מלאכותית לארגונים או לבנות הדרכת בינה מלאכותית לארגונים. לתכנון מסלול מתאים לצוות, פנו לצוות THE IMPACT.