מיכל אהרוני

מדידת השפעת AI על פרודוקטיביות אינה ספירת דקות שנחסכו בהדגמה. תהליך עשוי להיות מהיר יותר אך לייצר יותר תיקונים, להעביר עומס למאשר או לפגוע בלמידה. מדידה טובה בוחנת תהליך שלם, איכות, זמן, עלות וחוויית עבודה מול נקודת בסיס. היא גם מפרידה בין אימוץ, שימוש וערך: הרבה כניסות לכלי אינן הוכחה לתוצאה.


מגדירים יחידת עבודה ותוצאה


בוחרים משימה חוזרת כגון הכנת מסמך, טיפול בפנייה או ניתוח דוח. מגדירים התחלה וסוף, תוצר תקין ומי מאשר. מודדים בסיס במשך שבועיים: זמן פעיל, זמן המתנה, תיקונים ושגיאות. לאחר ההטמעה מודדים את אותם משתנים. אם המשימה השתנתה, מתעדים. השוואה ללא הגדרה קבועה יוצרת מספר מרשים שאינו ניתן לפעולה.


זמן שנחסך לעומת זמן שהועבר


AI עשוי לחסוך לכותב עשרים דקות ולהוסיף לבודק חצי שעה. לכן סוכמים זמן לאורך התהליך ולפי תפקיד. בודקים גם זמן למידה, טיפול בתקלות והזנת נתונים. חיסכון תיאורטי מוכפל במספר משימות רק כאשר בפועל זמן שהתפנה שימש לערך אחר. אחרת מדובר בקיבולת אפשרית, לא בתוצאה כספית.


איכות ורמת סיכון


לכל משימה מגדירים rubric: דיוק, שלמות, מקור, טון ועמידה בכללים. דוגמים תוצרים לפני ואחרי בבדיקה עיוורת כאשר אפשר. טעות קריטית מקבלת משקל שונה משגיאת ניסוח. בתהליך שמשפיע על אדם מוסיפים הוגנות, הסבר וערעור. ממוצע איכות אינו מסתיר כשל בקבוצה או מצב קצה.


ניסוי, קבוצת השוואה ולמידה


אם אפשר, משווים צוותים או תקופות דומות ומבצעים rollout הדרגתי. אין צורך במחקר אקדמי מלא, אך צריך להיזהר מעונתיות, שינוי ביקוש והבדלי ניסיון. אוספים גם דוגמאות איכותניות: מה המערכת אפשרה, היכן הפריעה ואיזה ידע חסר. שינוי אחד בכל פעם מקל לייחס תוצאה.


מסגרת יישום מעשית בארגון


פיילוט של שלושים יום כולל שבוע בסיס, הדרכה, שבועיים שימוש ושבוע ניתוח. המשתתפים עובדים על משימות אמת ומסמנים זמן ותיקון במדגם, לא בכל פעולה. מנהל בודק תוצרים לפי rubric. לאחר מכן מחליטים להרחיב, לשנות או לעצור. יעד נקבע מראש, למשל ירידה של 20% בזמן ללא ירידת איכות. תנאי זה מונע הכרזה בדיעבד.


מדידה, אחריות ולמידה


לוח מאוזן כולל זמן מחזור, איכות, שיעור תיקון, עלות, אימוץ, שביעות רצון, תקלות ולמידה. מציגים חציון ופיזור, לא רק ממוצע. מנתחים לפי תפקיד וניסיון. לאחר שלושה חודשים בודקים אם האפקט נשמר או דעך. מדד שאינו מוביל להחלטה מוסר כדי לצמצם עומס.


שאלות נפוצות


האם סקר עובדים מספיק?

לא. הוא חשוב אך משלים מדדי תהליך ואיכות. תחושה אינה מחליפה תוצאה.


איך מחשבים ROI?

מכמתים תועלת מאומתת פחות עלות כלי, יישום, הדרכה, בדיקה ותחזוקה, עם הנחות מפורשות.


כמה זמן צריך למדוד?

לפחות בסיס ותקופת שימוש מספקת למחזור העבודה; לאחר מכן בדיקת המשכיות.


מה מודדים בסדנת AI?

תוצר, זמן, תיקון, שימוש לאחר 30 יום ויכולת העובד להסביר ולבדוק.


מוכנות ארגונית לאחר הפיילוט


לפני הרחבה בודקים בעלים, תיעוד, הרשאות, תמיכה, נוהל אירוע ויכולת השבתה. עובד חדש צריך להבין את התהליך בלי תלות במי שבנה אותו. שינוי גרסה מריץ בדיקות מפתח. אחת לרבעון בוחנים אם המטרה, הנתונים והסיכון השתנו. כך תוצאה טובה נשמרת בשגרה ולא נשארת הדגמה.


הדרכה מחברת בין כלל לתרגול. המשתתפים עובדים על תרחיש אמת, מזהים כשל ומגדירים פעולה. לאחר שלושים יום מנתחים שימוש ודוגמאות ומעדכנים. העברת יכולת זו חשובה לא פחות מהמודל.


מדידה בלי להפוך עובדים למדד


נתוני שימוש יכולים להפוך בקלות למעקב. מגדירים מטרה, אוספים רק את הנדרש ומציגים לעובדים מה נמדד ולמה. ברירת המחדל היא ניתוח תהליך וצוות, לא דירוג אישי. אם נדרשת הערכה אישית, היא אינה נשענת על ציון סודי של מערכת. עובדים יכולים להוסיף הקשר ולערער על נתון. כך המדידה משרתת שיפור ולא פחד.


כדאי לשלב את העובדים בבחירת המדד. הם מזהים זמן נסתר, תיקון ועומס שמנהל אינו רואה. כאשר המדד משקף את העבודה, איכות הנתונים משתפרת. סקר קצר על שליטה, עומס ולמידה משלים את המספרים.


מתועלת תפעולית לערך עסקי


זמן שנחסך הופך לערך כאשר הוא מאפשר יותר שירות, פחות עיכוב, החלטה טובה או הפחתת סיכון. בונים שרשרת: שימוש יוצר שינוי התנהגות; שינוי משפיע על תהליך; התהליך משפיע על תוצאה. לכל חוליה אוספים ראיה. אם השרשרת נשברת, לא מייחסים הכנסה לכלי. אפשר לדווח גם ערך לא כספי, כגון עקביות או נגישות, עם מדד ברור.


עלות כוללת כוללת רישוי, אינטגרציה, הדרכה, בדיקות, ניטור, תמיכה וזמן מומחים. עלות נמוכה בפיילוט יכולה לגדול בהרחבה. מחשבים טווח ורגישות, לא מספר יחיד. הנהלה מקבלת החלטה גם כאשר אין ודאות מלאה, אך ההנחות כתובות.


למה אפקט דועך?


לאחר התלהבות ראשונית שימוש יורד אם המשימה אינה מתאימה, הכלי איטי, מנהלים אינם נותנים זמן או שאין משוב. לכן מודדים לאחר 30 ו-90 יום. אוספים דוגמאות של שימוש מוצלח וכשל, מעדכנים תבניות ומכשירים מנהלים. הצלחה בת קיימא היא יכולת צוותית, לא מומחה יחיד שמייצר תוצאות.


השוואה הוגנת בין צוותים


צוותים שונים בניסיון, עומס וסוג לקוחות. אין להשוות מספר גולמי בלי הקשר. אפשר להשתמש בשינוי יחסית לבסיס של כל צוות ולבדוק משימות דומות. הצגה של פיזור ומקרי קצה מונעת החלטה על בסיס ממוצע. כאשר אין קבוצת השוואה, מציינים את המגבלה.


החלטת הרחבה נרשמת עם מדד, הנחה, בעלים ותאריך בחינה הבא, כדי שאפשר יהיה ללמוד ולשנות.


מקורות והמשך קריאה


NIST AI Risk Management Framework — https://www.nist.gov/itl/ai-risk-management-framework

OECD AI and productivity work — https://www.oecd.org/

Stanford HAI AI Index — https://hai.stanford.edu/ai-index


מהידע ליכולת עבודה


צוות THE IMPACT יכול להגדיר פיילוט, baseline ומדדי אימוץ ואיכות. סדנאות AI: https://www.theimpact.co.il/%D7%A1%D7%93%D7%A0%D7%90%D7%95%D7%AA-ai-%D7%9C%D7%90%D7%A8%D7%92%D7%95%D7%A0%D7%99%D7%9D ותיאום: https://www.theimpact.co.il/%D7%A6%D7%A8%D7%95-%D7%A7%D7%A9%D7%A8

הערות
* כתובת הדואר האלקטרוני לא תוצג באתר.