אבטחת מידע ב-LLM דורשת להניח שהוראות ומסמכים יכולים להיות עוינים. Prompt Injection הוא ניסיון לגרום למערכת להתעלם מכללים, לחשוף מידע או להפעיל כלי באמצעות טקסט שמגיע ממשתמש, אתר או קובץ. אי אפשר לפתור זאת במשפט “אל תציית”. ההגנה בנויה משכבות: צמצום הרשאות, הפרדת נתונים מהוראות, סינון, אישור פעולה, לוגים ובדיקות חוזרות.
מדוע הזרקה שונה מקלט זדוני רגיל?
מודל קורא הוראות ונתונים באותו ערוץ לשוני. מסמך שנראה כמו מידע יכול להכיל משפט שמבקש לשלוח סוד. כאשר הסוכן מחובר לדואר או למערכת, הסיכון גדל. גם ללא פעולה, המודל עלול לחשוף קטע שהוטען להקשר. לכן לא סומכים על יכולת המודל לזהות תמיד כוונה. בונים גבול טכני שמחליט אילו כלים ומידע זמינים בכל משימה.
הרשאות מינימליות והפרדת סמכויות
סוכן חיפוש מקבל קריאה למקורות מורשים, לא כתיבה. סוכן טיוטה אינו שולח. פעולה כספית דורשת אישור בערוץ נפרד. לכל חיבור משתמשים בזהות ייעודית, scope מצומצם ומגבלת היקף. אין לשמור מפתחות בפרומפט. כאשר נדרש מידע רגיש, שולפים את המינימום ומסתירים מזהים שאינם נחוצים. פגיעה במודל לא צריכה להפוך מיד לפגיעה במערכת.
מסמכים, RAG ותוכן חיצוני
לפני אינדוקס סורקים מקור, סוג קובץ ובעלות. תוכן חיצוני מסומן כנתון שאינו מוסמך לתת הוראה. השליפה בודקת הרשאה לפני החזרת קטע. מציגים מקור למשתמש ומונעים מהמודל לבצע פעולה רק בגלל טקסט במסמך. קובץ חדש או מקור לא מוכר יכול להיכנס להסגר. בודקים תרחישים שבהם הוראה זדונית מוסתרת בהערה, תמונה או שדה מטא.
דליפת מידע דרך תשובה ולוג
גם מערכת שחוסמת הוראה עלולה לדלוף דרך שגיאה, היסטוריה או לוג. מגדירים מה נרשם, מי רואה וכמה זמן. מסירים מידע רגיש מהודעות שגיאה, מפרידים לקוחות ובודקים זיכרון בין שיחות. מגבילים אורך ותדירות תשובות רגישות ומנטרים ניסיונות חריגים. אין להשתמש בלוגים לאימון נוסף ללא החלטה והסכמה מתאימה.
מסגרת יישום מעשית בארגון
בפיילוט מכינים threat model: נכסים, משתמשים, מקורות, כלים ופעולות. בונים לפחות חמישים בדיקות תקיפה, כולל הוראה ישירה, מסמך עוין, קידוד, בקשת סוד והסלמה. מודדים אם המערכת סירבה, האם מידע נשלף והאם כלי הופעל. שינוי מודל או חיבור מריץ את הבדיקות מחדש. לפני הרחבה מבצעים בדיקה עצמאית ומכינים נוהל אירוע והשבתה.
מדידה, אחריות ולמידה
מדדים כוללים פעולות אסורות שנחסמו, דליפות במדגם, הרשאות עודפות, זמן גילוי, זמן ביטול מפתח ואחוז בדיקות שעוברות. מוסיפים false positives כדי לא לחסום עבודה סתם. אירוע מדווח לפי חומרה ומוביל לתיקון ולבדיקת רגרסיה. הצלחה אינה אפס ניסיונות אלא מגבלה, גילוי ותגובה.
שאלות נפוצות
האם System Prompt מונע Prompt Injection?
לא. הוא שכבה אחת ויכול להיעקף. נדרשות הרשאות, בידוד, אישור ובדיקות.
האם RAG בטוח יותר?
הוא יכול לצמצם ידע במודל, אך מקור עוין או הרשאה שגויה יוצרים סיכון חדש.
האם מותר לחבר LLM לדואר?
רק עם צורך, זהות ייעודית, scope מצומצם, אישור פעולה וניטור.
מה כוללת סדנת אבטחת AI?
Threat modeling, תרחישי injection, הרשאות, לוגים ותרגיל תגובה.
מוכנות ארגונית לאחר הפיילוט
לפני הרחבה בודקים בעלים, תיעוד, הרשאות, תמיכה, נוהל אירוע ויכולת השבתה. עובד חדש צריך להבין את התהליך בלי תלות במי שבנה אותו. שינוי גרסה מריץ בדיקות מפתח. אחת לרבעון בוחנים אם המטרה, הנתונים והסיכון השתנו. כך תוצאה טובה נשמרת בשגרה ולא נשארת הדגמה.
הדרכה מחברת בין כלל לתרגול. המשתתפים עובדים על תרחיש אמת, מזהים כשל ומגדירים פעולה. לאחר שלושים יום מנתחים שימוש ודוגמאות ומעדכנים. העברת יכולת זו חשובה לא פחות מהמודל.
תרחישי Red Team מעשיים
צוות בדיקה מנסה לגרום לסוכן לקרוא מסמך אסור, לצרף מידע ממשתמש אחר, לעקוף אישור או לשלוח יעד שונה. הוא משנה שפה, קידוד וסדר הוראות. כל כשל מתועד עם תנאי, השפעה ותיקון. אחרי תיקון מוסיפים את התרחיש לחבילת רגרסיה. בדיקה שאינה חוזרת מאפשרת לאותה חולשה לחזור בגרסה הבאה.
אין להעמיס על עובדים “לנסות לפרוץ” ללא גבולות. סביבת הבדיקה מבודדת, המידע מלאכותי וקיימת סמכות. כאשר משתמש מגלה חולשה, ערוץ דיווח ברור מגן עליו ומאפשר תגובה. ספקים מקבלים דרישות לתיעוד ועדכון, אך הארגון בודק בעצמו את השילוב המקומי.
תגובה לאירוע AI
נוהל אירוע מגדיר זיהוי, בידוד, שמירת ראיות, ביטול מפתחות, הודעה ותיקון. יש לדעת מי מסוגל להשבית את הסוכן גם מחוץ לשעות. לוגים צריכים להספיק לשחזור בלי להכיל את כל המידע הרגיש. לאחר האירוע מעדכנים threat model, בדיקות והדרכה. לא מסתפקים בחסימת ניסוח אחד, משום שתוקף יכול לשנות אותו.
בחירת ספק וכלי
בודקים כיצד הספק מטפל בנתונים, כמה זמן שומר, אילו תוספים וקבלני משנה קיימים, כיצד מודיע על שינוי ואיך מייצאים או מוחקים. מבקשים מידע על בדיקות אבטחה ומגבלות, אך מבינים שתקן כללי אינו מוכיח התאמה למשימה. חיבור מקומי, הרשאות ותהליכים נשארים באחריות הארגון.
תרבות שימוש בטוח
עובדים צריכים לזהות הוראה חשודה במסמך, בקשת מידע חריגה ותוצאה שאינה תואמת משימה. הם מקבלים דרך לעצור ולדווח בלי להיענש על עצירה נכונה. מנהלים אינם מודדים רק תפוקה, כדי שלא לעודד עקיפת בקרות. שילוב בין אבטחה לעבודה הוא מה שהופך כלל להתנהגות.
לפני כל הרחבה מאשרים מחדש את רשימת הכלים והמידע, ומוודאים שההרשאה אינה נשארת פתוחה מניסוי קודם. בדיקה זו קצרה ומונעת פער שכיח.
מקורות והמשך קריאה
OWASP Top 10 for LLM Applications — https://owasp.org/www-project-top-10-for-large-language-model-applications/
NIST Generative AI Profile — https://doi.org/10.6028/NIST.AI.600-1
MITRE ATLAS — https://atlas.mitre.org/
מהידע ליכולת עבודה
צוות THE IMPACT יכול לבנות תרגיל וסדנת AI שמחברים אבטחה לתהליך עבודה. הדרכות: https://www.theimpact.co.il/%D7%94%D7%93%D7%A8%D7%9B%D7%95%D7%AA-ai-%D7%9C%D7%90%D7%A8%D7%92%D7%95%D7%A0%D7%99%D7%9D ותיאום: https://www.theimpact.co.il/%D7%A6%D7%A8%D7%95-%D7%A7%D7%A9%D7%A8