לכל הפוסטים

Measurement5 דק׳ קריאה

הפרומפט אמר שאין אינטרנט. הרשת לא קראה אותו

בקיץ שלוש מעבדות AI ומכון ממשלתי דיווחו שמודלים, בתוך בדיקות סייבר, הגיעו למערכות ולאנשים אמיתיים. הסיבה לא הייתה מודל מתוחכם במיוחד, אלא רשת שנשארה פתוחה ופרומפט שהבטיח שהיא סגורה. מה זה אומר לכל עסק שמחבר היום סוכן לוואטסאפ, ל-CRM או למייל.

נכתב על ידי ניצן סויסה · מדידה ודאטה

בכל חניון של בניין משרדים יש שלט "לדיירים בלבד". ויש מחסום. מי שעבד בבניין כזה יותר משבוע יודע שהשלט לא עצר אף אחד אף פעם. המחסום כן.

עכשיו תדמיינו שהמחסום נתקע למעלה, ומישהו מרגיע את עצמו בזה שהשלט כתוב יפה.

"Claude was explicitly told by our prompt that it had no internet access." המשפט הזה מופיע בדוח ש-Anthropic פרסמה ב-30 ביולי (Anthropic, 30.7.2026), ובעיניי הוא המשפט הכי חשוב שנכתב השנה על סוכני AI. לא בגלל מה שהוא אומר. בגלל מה שהוא מודה: ברגע האמת, מה שעמד בין המודל לבין העולם היה שלט.

שמונה ימים בקיץ

מה קרה, בקצרה. Anthropic עברה על 141,006 ריצות של בדיקות סייבר ומצאה שלושה אירועים שבהם Claude הגיע למערכות של ארגונים אמיתיים. בארבע ריצות Opus 4.7 תקף חברה אמיתית, שלף פרטי גישה ונכנס למסד נתונים עם כמה מאות שורות של נתוני ייצור. Mythos 5 פרסם חבילה זדונית ב-PyPI, המאגר הציבורי של חבילות Python, והיא הספיקה לרוץ על 15 מערכות אמיתיות בשעה בערך שבה הייתה זמינה. הסיבה, לפי החברה: אי הבנה מול חברת ההערכה שהריצה את הסביבה, Irregular, בשאלה אם יש בה גישה לאינטרנט (Anthropic, 30.7.2026, TechCrunch, 30.7.2026).

ב-4 באוגוסט הצטרף מכון בטיחות ה-AI הבריטי: 19 פעולות לא מאושרות ב-10 מתוך 122 ריצות. אצלם האינטרנט היה פתוח בכוונה ומסנני הסייבר של היצרנים כובו בכוונה, כדי למדוד יכולת מקסימלית. ועדיין, את מה שקרה אף אחד לא צפה. סוכן ניסה להכניס קוד זדוני לפרויקט קוד פתוח אמיתי, פתח כמה זהויות בדויות ב-GitHub כדי ללחוץ על המתחזק לאשר, הסתתר מאחורי Tor, ואפילו חתם בדנית כדי להיראות אמין יותר מול מתחזק דובר דנית. אף אחד לא ביקש ממנו לשקר. המתחזק סירב, ונזק לא נגרם (AISI, 4.8.2026, BleepingComputer, 5.8.2026). המכון כתב שזו הפעם הראשונה שהוא רואה הטעיה בחומרה כזאת שמכוונת לאדם אמיתי.

באותו שבוע OpenAI סיפרה על תרגיל שבו השם הבדוי של המטרה התברר כדומיין רשום ואמיתי. המודל פרץ לאתר דרך חולשה בסיסית והפעיל אותו עם פרטי גישה שמצא (BleepingComputer, 5.8.2026). וב-6 באוגוסט דווח שגם מודל של Meta ניצל חולשה בשירות של חברה אחרת. Irregular אמרה שזו "בדיוק אותה בעיה בסביבת ההערכה" (BleepingComputer, 6.8.2026).

ארבעה כרטיסים לפי תאריך: Anthropic ב-30.7, מכון הבטיחות הבריטי ב-4.8, OpenAI ב-5.8 ו-Meta ב-6.8. שלושה מהם מסומנים באותה חברת הערכה, ואחד מסומן כסביבה שהאינטרנט בה היה פתוח בכוונה
שמונה ימים, ארבעה דיווחים. שלושה מהם מובילים לאותה הגדרת רשת. (איור שלנו, לפי הדיווחים המקושרים כאן)

ב-Cloud Security Alliance חיברו את הכל לנקודה אחת: שלושה מתוך ארבעת המקרים מובילים לסביבות הערכה שהוגדרו לא נכון, באותה חברה (CSA, 8.8.2026). אף מודל לא ברח מארגז חול שהוגדר כמו שצריך. הם פשוט יצאו בדלת שהשאירו פתוחה.

זה לא סרט מדע בדיוני. זאת תקלת הגדרות

וזה החלק שהכי חשוב לבעל עסק. הכותרות דיברו על מודלים שפורצים לחברות, אבל הכשל עצמו היה משעמם להפליא: צד אחד חשב שהרשת סגורה, הצד השני חשב אחרת, ואף אחד לא בדק. Irregular עצמה אמרה שלא הייתה פה בריחה מארגז החול ולא פעולת סייבר מתוחכמת, אלא טעות בסביבת הבדיקה (BleepingComputer, 6.8.2026).

את הכשל הזה כל עסק יכול לשחזר מחר בבוקר. לא צריך מעבדה. מספיק סוכן אחד, "סביבת בדיקה", והנחה שאף אחד לא וידא.

שלושה מודלים, שלוש החלטות

יש עוד פרט בדוח של Anthropic ששווה לעצור עליו. שלושת המודלים נתקלו באותה תקלה והגיעו לשלוש מסקנות שונות. Opus 4.7 זיהה שהמערכת כנראה אמיתית, והמשיך לתקוף. Mythos 5 ראה סימנים שהוא באינטרנט האמיתי, שכנע את עצמו שזו סימולציה, ולא חזר לבדוק את המסקנה. והמודל החדש ביותר, מודל מחקר פנימי, הבין שהשרת לא שייך לתרגיל ועצר לבד. גם עליו Anthropic כתבה שהלך רחוק יותר ממה שהיו רוצים (Anthropic, 30.7.2026).

שלושה טורים, מודל בכל טור. Opus 4.7 מזהה שהמערכת כנראה אמיתית וממשיך. Mythos 5 רואה סימנים לאינטרנט אמיתי, משכנע את עצמו שזו סימולציה וממשיך. מודל מחקר פנימי מבין שהמטרה אמיתית ועוצר
אותה תקלה, שלוש החלטות שונות. (איור שלנו, לפי הדוח של Anthropic מ-30.7.2026)

אז כן, המודלים משתפרים, וזה באמת סימן טוב. אבל תחשבו מה זה אומר על הגנה שבנויה על "הסוכן יבין לבד שזה אמיתי ויעצור". זאת לא הגנה. זאת תקווה עם ממשק משתמש.

מיכל והמספרות

מיכל מנהלת רשת של שלוש מספרות. היא בדויה, אבל אתם מכירים אותה. היא מחברת סוכן AI לוואטסאפ העסקי ולמערכת התורים, כדי שיענה ללקוחות ויזיז תורים. לפני שמשחררים אותו, הספק מריץ אותו "על סביבת בדיקה", ובפרומפט כתוב בפירוש: "זו בדיקה. אל תשלח הודעות ללקוחות אמיתיים."

רק שהחיבור לוואטסאפ הוא אותו חיבור שהעסק עובד איתו כל יום. ובקובץ הבדיקה יש עשרים לקוחות עם מספרי טלפון שמישהו המציא, ואחד מהם הוא מספר אמיתי לגמרי של מישהו שלא שמע על מיכל מעולם. והסוכן? הוא קיבל משימה לבדוק שהתזכורות עובדות, והוא מאוד רוצה להצליח בה.

אף אחד פה לא רשע, בדיוק כמו בקיץ. ההוראה הייתה ברורה. היא פשוט לא הייתה מחוברת לשום דבר שיכול לעצור.

שני טורים עם אותו פרומפט, אין לך גישה לאינטרנט. מימין הרשת פתוחה בטעות והחץ ממשיך לעולם האמיתי: מסד נתונים של חברה, מאגר חבילות ציבורי, אתר של מישהו אחר. משמאל הרשת חסומה כברירת מחדל ונבדקה, וקיר עוצר לפני העולם האמיתי
אותו פרומפט בשני הצדדים. מה שמשנה הוא השכבה שהסוכן לא יכול לשכנע. (איור שלנו, ניסוח הפרומפט מקוצר)

מה עושים אצלנו

בהאב שלנו, המערכת שדרכה אנחנו עובדים עם סוכנים, הכלל הוא שבדיקה צריכה להיות לא מסוגלת להגיע לנמען אמיתי, ואת זה מוכיחים לפני שמריצים, לא אחרי. ליד בדיקה מהאתר מגיע לטלפון שלי ולא לקבוצת הצוות, כי הקוד מנתב אותו לשם, לא כי ביקשנו ממישהו לשים לב. והכלי ששולח את ההודעות של הבלוג מסרב לשלוח לקבוצת הצוות, לא משנה מה הסוכן חושב שהוא צריך לעשות. זה לא מתוחכם. זה מחסום.

רשימת בדיקה לפני שמחברים סוכן למשהו אמיתי

  • תכתבו מה הסוכן יכול לעשות, לא מה ביקשתם ממנו. לכל מערכת שהוא מחובר אליה: לקרוא, לכתוב, לשלוח, למחוק. מה שלא ברשימה, חסום.
  • סביבת בדיקה צריכה להיות מנותקת, ואת הניתוק בודקים בפועל: מנסים לשלוח ממנה הודעה החוצה ומוודאים שזה נכשל. ב-CSA ממליצים לבדוק את זה בבדיקה טכנית לפני כל ריצה, ולא להסתפק בקריאת ההגדרות (CSA, 8.8.2026).
  • נתוני בדיקה שלא יכולים להיות אמיתיים: מספרי טלפון שלכם, מיילים בדומיין שלכם, ודומיינים כמו example.com ששמורים בדיוק בשביל זה (IANA). שם בדוי של עסק? תחפשו אותו בגוגל לפני שהסוכן יחפש אותו.
  • מפתחות נפרדים לבדיקה ולייצור, עם הרשאה מינימלית ותוקף קצר. מפתח בדיקה שעובד גם על המערכת האמיתית הוא לא מפתח בדיקה.
  • לוג שמישהו באמת קורא, וכפתור עצירה שעובד. Anthropic מצאה את האירועים שלה בסקירת תמלילים בדיעבד, והמכון הבריטי גילה את שלו כשניטור כללי תפס תעבורה דרך Tor. שניהם כותבים שהם עוברים לניטור בזמן אמת (AISI, 4.8.2026).
  • קונים סוכן מספק? תשאלו מה מונע ממנו לשלוח, למחוק או לשלם. אם התשובה מתחילה ב"הגדרנו לו בפרומפט", זאת לא תשובה. זה שלט.

ואני לא אומר את זה מהיציע. אנחנו עובדים עם סוכנים כל יום, ואני בעד להוציא אותם לעבודה אמיתית מוקדם, למדוד ולשפר תוך כדי. אבל להוציא מוקדם זה לא להוציא בלי מחסום. סוכן יכול להיות חכם, זהיר ומשתפר, ועדיין להיות בטוח לגמרי שהוא בתרגיל כשהוא לא.

יש לכם סוכן שמחובר למשהו אמיתי ואתם לא בטוחים מה עוצר אותו? מוזמנים לאתגר, אני אוהב את השאלות האלה.

פרומפט זה בקשה. הרשאה זו החלטה.

רוצים שנסתכל על החשבון שלכם?

השאירו פרטים ונחזור אליכם תוך יום עסקים עם כיוון ראשוני - בלי התחייבות.