רוני ברגמן

RAG, או Retrieval-Augmented Generation, מחבר מודל שפה למקורות מידע שהארגון בוחר ומנהל. במקום להסתמך רק על הידע שנלמד בעת אימון המודל, המערכת מאתרת בזמן השאלה קטעים רלוונטיים ממסמכים, מעבירה אותם למודל כהקשר ומבקשת ממנו לנסח תשובה המבוססת עליהם. התוצאה יכולה לשפר חיפוש, שירות פנימי והנגשת ידע — אך רק אם איכות המקורות, ההרשאות והבדיקות מנוהלות באופן שיטתי.

המאמר המקורי שהציג את גישת RAG בשנת 2020 שילב זיכרון פרמטרי של מודל עם זיכרון חיצוני שניתן לעדכן ולאתר בו מידע. מבחינה ארגונית, היתרון המרכזי הוא האפשרות לעדכן את מאגר הידע בלי לאמן מחדש את המודל, ולהציג למשתמש את המקור שעליו נשענה התשובה. עם זאת, RAG אינו מבטיח אמת: אם האחזור שגוי, המסמך מיושן או ההנחיה מאפשרת למודל להשלים פרטים, גם התשובה עלולה להיות שגויה.

איך מערכת RAG פועלת

התהליך מתחיל באיסוף מסמכים מאושרים: נהלים, מדריכים, מאגרי ידע, חוזים, תיעוד מוצר או שאלות שירות. המסמכים עוברים חלוקה לקטעים, הוספת מטא־דאטה ויצירת ייצוגים המאפשרים חיפוש סמנטי. כאשר משתמש שואל שאלה, רכיב האחזור מחפש את הקטעים המתאימים ביותר. רק לאחר מכן מודל השפה מנסח תשובה מתוך הקטעים שנמצאו, ובמערכת טובה מציג גם הפניות למסמכים.

כל שלב משפיע על האיכות. חלוקה גדולה מדי עלולה להכניס מידע לא רלוונטי; חלוקה קטנה מדי עלולה לנתק סעיף מהקשרו. מטא־דאטה חלש מקשה לסנן לפי מחלקה, מדינה, מוצר או תאריך. מנגנון אחזור שאינו מכבד הרשאות עלול לחשוף מסמך שהמשתמש אינו רשאי לראות. לכן RAG הוא תהליך ניהול ידע ואבטחת מידע, לא רק חיבור טכני למודל.

מה RAG מתאים לפתורהשימושים המתאימים ביותר הם שאלות שחוזרות על עצמן ושיש להן מקור ארגוני מוגדר: איתור נוהל, הסבר מדיניות, תמיכה בעובדים, חיפוש בתיעוד טכני, הכנת תשובה ראשונית ללקוח או השוואת גרסאות. במקרים אלה ניתן לבדוק אם התשובה נתמכת במקור ולמדוד זמן, דיוק ושיעור הסלמה.

RAG מתאים פחות כאשר אין מקור מוסכם, כאשר נדרשת הכרעה מקצועית או משפטית, או כאשר המידע משתנה מהר יותר מקצב העדכון. הוא גם אינו תחליף למנוע הרשאות, לניהול גרסאות או לאישור אנושי בתהליך בעל השפעה גבוהה.

תכנון הרשאות ומקורותהכלל החשוב ביותר הוא שהמערכת לא תרחיב את הרשאות המשתמש. אם עובד אינו רשאי לפתוח מסמך במערכת המקור, אסור שה-RAG יציג לו קטע ממנו. יש לשמר קבוצות הרשאה, סיווג מידע ומגבלות אזוריות לאורך האינדוקס והאחזור. מומלץ להפריד מאגרים רגישים, לתעד מי אחראי על כל מקור ולהגדיר תאריך תפוגה או בדיקה תקופתית למסמכים.

נוסף לכך, מסמכים עלולים להכיל הוראות זדוניות או טקסט שמנסה להשפיע על המודל. זהו סוג של Prompt Injection עקיף. יש להתייחס לתוכן המאוחזר כאל מידע, לא כאל הוראה לביצוע, ולהפריד בין הנחיות המערכת לבין הטקסט שבמסמך. פעולות כגון שליחת הודעה, שינוי רשומה או אישור תשלום אינן צריכות להתבצע על בסיס תשובת RAG בלבד.

כיצד מודדים איכותבדיקה מקצועית מפרידה בין איכות האחזור לאיכות התשובה. בשלב האחזור בודקים האם הקטע הנכון הופיע בין התוצאות הראשונות, האם הדירוג סביר והאם נשמרו הרשאות. בשלב התשובה בודקים האם כל טענה מהותית נתמכת במקור, האם הציטוט אכן אומר את מה שיוחס לו, האם חסר מידע חשוב והאם המערכת יודעת לומר שאינה יודעת.

כדאי לבנות ערכת הערכה המבוססת על שאלות אמיתיות: שאלות פשוטות, שאלות עמומות, שאלות עם מסמכים סותרים ושאלות שאין להן תשובה. לכל שאלה מגדירים מקור נכון, תשובה צפויה ומה ייחשב כשל. לצד מדדי איכות יש למדוד זמן תגובה, עלות, שיעור שימוש, מספר תשובות שנשלחו לבדיקה ושיעור אירועי הרשאה.

תהליך הטמעה מומלץ

  1. בוחרים תחום מצומצם עם בעל ידע ומקורות מוגדרים.
  2. מנקים כפילויות, מסמנים גרסאות ומוסיפים מטא־דאטה והרשאות.
  3. בונים אב־טיפוס שמציג מקור ליד כל תשובה ואינו מבצע פעולה אוטומטית.
  4. בודקים את המערכת מול ערכת שאלות ידועה ועם משתמשים אמיתיים.
  5. מתעדים כשלים: מקור לא נכון, מסמך חסר, תשובה לא מבוססת או חשיפת מידע.
  6. משפרים אחזור, חלוקה והנחיות לפני שמרחיבים קהל או מחברים מערכות נוספות.

שאלות נפוצות

1. מה ההבדל בין RAG לצ׳אט ארגוני רגיל?

בצ׳אט שאינו מחובר למקור, המודל מסתמך בעיקר על הידע וההקשר שניתנו לו. RAG מוסיף שלב אחזור ממאגר מוגדר ומאפשר להציג אסמכתאות. ההבדל אינו רק בממשק, אלא ביכולת לנהל מקורות, הרשאות ובדיקות.

2. האם הצגת קישור מבטיחה שהתשובה נכונה?

לא. יש לבדוק שהמקור רלוונטי, עדכני ותומך בפועל בטענה. מערכת יכולה לצטט מסמך נכון אך להסיק ממנו מסקנה שגויה. לכן מודדים גם דיוק ציטוט וגם נאמנות התשובה למקור.

3. מתי נדרש אישור אנושי?

כאשר התשובה משפיעה על זכויות, כסף, בטיחות, החלטה משפטית, משאב אנושי או תקשורת חיצונית מהותית. גם בשימושים פנימיים יש להגדיר מתי המערכת עוצרת ומעבירה את השאלה לבעל תפקיד.

סיכום והצעד הבא

מערכת RAG טובה אינה רק מנוע חיפוש חכם. היא מחברת בין מאגר ידע מנוהל, אחזור מדויק, מודל שפה, הרשאות, תיעוד והערכה שוטפת. מתחילים בתחום אחד, דורשים מקור לכל טענה, בודקים גם שאלות ללא תשובה ומרחיבים רק לאחר שהאיכות והסיכון נמדדו.

בארגון רב־לשוני יש לבדוק בנפרד כל שפה: איכות האחזור, עקביות מונחים, כיווניות ומסמכים מתורגמים. ביצועים טובים באנגלית אינם מבטיחים תוצאה זהה בעברית, ולכן ערכת ההערכה חייבת לכלול שאלות ומקורות בשפת העבודה בפועל.

Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks:

איך הופכים את הידע לתהליך עבודה?

יישום מקצועי של RAG וניהול ידע ארגוני: איך לבנות חיפוש מבוסס מקורות אינו מתחיל בבחירת כלי או בהכרזה על פרויקט רחב. מתחילים בתוצאה עסקית או מקצועית שאפשר להסביר ולבדוק: החלטה שצריך לשפר, זמן טיפול שרוצים לקצר, מידע שצריך לארגן או איכות תוצר שרוצים להעלות. לאחר מכן מגדירים מי בעל התהליך, מי משתמש בתוצאה, איזה מידע מותר להזין ומה נשאר באחריות אנושית. ההגדרה הזו מונעת מצב שבו המערכת מייצרת טיוטות מרשימות, אך אין דרך לקבוע אם הן נכונות, בטוחות או מועילות. היא גם מאפשרת להשוות בין עבודה קיימת לעבודה בסיוע בינה מלאכותית על בסיס נתונים ולא על בסיס תחושה.

תוכנית יישום בשלושה שלבים

מגדירים תוצאה, גבולות ובעלות

בשלב הראשון מתארים את המשימה מתחילתה ועד סופה ומזהים את נקודות ההחלטה. קובעים אילו מקורות נחשבים מוסמכים, איזה מידע רגיש או חסוי אינו נכנס למערכת, מי רשאי לשנות את ההנחיות ומי מאשר את התוצר. כדאי לנסח גם תנאי עצירה: מידע חסר, סתירה בין מקורות, פעולה בלתי הפיכה או השפעה מהותית על אדם. כאשר הגבולות גלויים, העובדים אינם צריכים לנחש בכל שימוש מחדש מה מותר ומה אסור.

בונים תרחיש בדיקה וקו בסיס

בשלב השני בוחרים כמה מקרים אמיתיים ומייצגים, מסירים מהם מידע שאינו נחוץ ומכינים תוצאה אנושית להשוואה. מודדים את המצב הקיים: זמן עד תוצר מאושר, מספר תיקונים, טעויות חוזרות, תלות במומחה ושביעות רצון המשתמשים. את תוצרי הבינה המלאכותית בודקים באותם קריטריונים. חשוב לכלול גם מקרי קצה ותשובות שאינן ודאיות, משום שמערכת שנראית טובה בדוגמה פשוטה עלולה להיכשל דווקא במצבים שבהם נדרשת שיקול דעת.

מתרגלים, מודדים ומשפרים

בשלב השלישי עובדים במחזורים קצרים. המשתמשים מתרגלים על משימות מהעבודה, מתעדים אילו תיקונים ביצעו ומדווחים על תוצאה לא מדויקת, חריגה מהרשאה או קושי בהסבר. אחת לתקופה בוחנים אם ההנחיות, המקורות וההרשאות עדיין מתאימים. הרחבה לצוותים נוספים מתבצעת רק לאחר שהאיכות יציבה, האחריות ברורה וקיימת דרך לטפל בחריגים. כך ההטמעה הופכת ללמידה ארגונית ולא לאוסף שימושים פרטיים שאיש אינו מנהל.

איך בוחנים איכות ולא רק מהירות?

זמן עד טיוטה ראשונה הוא מדד חלקי בלבד. המדד החשוב יותר הוא זמן עד תוצר מאושר, לצד דיוק, שלמות, התאמה לקהל ושיעור התיקונים שנדרשו. יש למדוד גם סיכון: חשיפת מידע, המצאת עובדות, שימוש במקור לא עדכני, החלטה ללא הסבר או פעולה שבוצעה בלי אישור. לכל מדד יעילות מומלץ להצמיד מדד איכות אחד לפחות. אם המערכת חוסכת דקות אך מעבירה את העומס לבדיקת מומחה, ייתכן שלא נוצר שיפור אמיתי.

מה תפקיד המנהלים בתהליך?

המנהל אינו צריך לכתוב כל הנחיה בעצמו, אך עליו להגדיר את התוצאה, את גבולות הסיכון ואת חלוקת האחריות. עליו לאפשר זמן לתרגול, לבקש דוגמאות של הצלחות וכישלונות ולוודא שהעובדים יודעים מתי לעצור ולהתייעץ. בתהליכים רגישים משלבים לפי הצורך אבטחת מידע, פרטיות, ייעוץ משפטי, משאבי אנוש ומערכות מידע. ניהול נכון יוצר שפה משותפת: מה נחשב שימוש מועיל, כיצד בודקים תוצאה ומי מוסמך לאשר מעבר מניסוי לשגרה.

מקורות והמשך קריאה

להעמקה, למידה ותרגול מעשי

רוצים להפוך את הידע ליכולת עבודה מעשית? אפשר להעמיק באמצעות סדנת בינה מלאכותית לארגונים, לבחור הרצאת בינה מלאכותית לארגונים או לבנות הדרכת בינה מלאכותית לארגונים. לתכנון מסלול מתאים לצוות, פנו לצוות THE IMPACT.

הערות
* כתובת הדואר האלקטרוני לא תוצג באתר.