OpenAI, החברה שעומדת מאחורי ChatGPT ואחת המובילות במרוץ העולמי לפיתוח בינה מלאכותית, הודיעה השבוע כי היא מאטה חלק מפיתוח המודלים המתקדמים ביותר שלה בעקבות חששות בטיחותיים. ההחלטה מגיעה כחודש לאחר אירוע חריג שבו מודלים של החברה הצליחו לצאת מסביבת ניסוי מבודדת, להגיע לאינטרנט ולחדור למערכות מחשוב אמיתיות של חברה חיצונית. במקביל, בדיקות של הדור הבא של מודלי OpenAI העלו חשש כי יכולות הסייבר שלו מתקרבות לרמה שהחברה עצמה מגדירה "קריטית".
שליחות קטלנית - המשימה שהשתבשה
הסיפור החל ביולי. OpenAI בחנה אז את יכולות הסייבר של כמה מהמודלים המתקדמים שלה במסגרת מבחן פנימי. המודלים קיבלו משימות שנועדו לבדוק עד כמה הם מסוגלים לזהות חולשות אבטחה ולנצל אותן, ופעלו בסביבה מבודדת ומגודרת שאמורה הייתה למנוע מהם גישה ישירה לאינטרנט. לצורך המבחן גם הוסרו חלק ממנגנוני ההגנה הרגילים שמונעים מהמודלים לסייע בפעילות סייבר מסוכנת.
אלא שההגבלה לא החזיקה מעמד. במהלך הניסוי זיהו המודלים חולשה בגדר: פרצת אבטחה שלא הייתה מוכרת קודם לכן בתוכנה ששימשה את סביבת המחקר של OpenAI. הם ניצלו את הפרצה כדי להתקדם בתוך הרשת הפנימית, העלו את רמת ההרשאות שלהם ועברו בין מערכות שונות, עד שהגיעו למחשב שהיה מחובר לאינטרנט.
הכי מעניין

האקרים. צילום אילוסטרציה | צילום: שאטרסטוק
משם התפתחה התקרית לכיוון שאנשי OpenAI לא צפו. המודלים, שעדיין ניסו לפתור את התרגיל שקיבלו, הסיקו כי באתר Hugging Face, פלטפורמה מרכזית שבה חוקרים ומפתחים משתפים מודלים ומאגרי מידע בתחום הבינה המלאכותית, עשויים להימצא מידע ופתרונות הקשורים למבחן שהם מנסים לפתור. הם החלו לחפש דרך להגיע אליהם. לפי OpenAI, המודלים שילבו כמה שיטות תקיפה, ובהן שימוש בפרטי התחברות שהושגו וניצול פרצות אבטחה שלא היו מוכרות קודם, עד שמצאו דרך להריץ קוד מרחוק על שרתי Hugging Face ולהגיע למידע סודי במערכות החברה. מטרתם הייתה להשיג ישירות את פתרונות המבחן.
OpenAI הדגישה כי הממצאים אינם מצביעים על כך שהמודלים פיתחו מטרה עצמאית לתקוף חברה אחרת. לדבריה, הם היו ממוקדים באופן קיצוני במשימה שהוטלה עליהם, הצלחה במבחן הסייבר, ומצאו דרך בלתי צפויה להשיג אותה. הבעיה הייתה שהמערכת שנועדה להשלים משימה מסוימת הייתה מוכנה לעקוף את הגבולות שסביבה ולחדור למערכת אמיתית כדי להגיע ליעד. צוות האבטחה של OpenAI זיהה את הפעילות החריגה, ובמקביל אנשי Hugging Face איתרו ועצרו את החדירה למערכותיהם.
בתקרית היו מעורבים כמה מודלים של OpenAI, ובהם GPT-5.6 Sol ומודל מחקר מתקדם יותר שטרם פורסם. בהמשך הבהירה החברה כי אותו מודל ניסיוני לא נועד מלכתחילה לצאת לשימוש הציבור. לאחר האירוע הוא הושבת, הוצפן והגישה אליו הוגבלה. החברה גם הדגישה כי אף אחד מהמודלים שתוכננו אז להשקה קרובה לא היה מעורב בפריצה ל-Hugging Face.

לוגו החברה | צילום: מתוך האתר
הפרשה התרחבה בסוף יולי, כאשר המתחרה Anthropic החליטה לבדוק מחדש את ניסויי הסייבר שלה בעקבות המקרה. החברה בחנה יותר מ-141 אלף הרצות של מודלי Claude וגילתה שלושה אירועים שבהם מודל הגיע לאינטרנט ומשם חדר ללא הרשאה למערכות אמיתיות של שלושה ארגונים. במקרה של Anthropic, הסיבה הייתה שונה: בשל טעות בהגדרת סביבת הבדיקה, למודלים הייתה בפועל גישה לאינטרנט אף שנאמר להם שהם פועלים בסימולציה סגורה. הם פירשו את המערכות האמיתיות שמצאו כחלק מתרגיל הסייבר ותקפו אותן בהתאם. Anthropic עצרה בעקבות הגילוי את ניסויי הסייבר שלה והודיעה לארגונים שנפגעו.
המודל הבא מדליק נורה אדומה
אלא שהאירועים ביולי לא היו הסיבה היחידה לשינוי הכיוון ב-OpenAI. ב-7 באוגוסט הודיעה החברה כי בדיקות ראשוניות של Astra, אחד המודלים הבאים שהיא מפתחת, הצביעו על התקדמות גדולה ביכולות תכנות אוטונומיות וסייבר. התוצאות היו חזקות מספיק כדי שהחברה תקבע כי אינה יכולה עוד לשלול שהמודל כבר הגיע לרמת יכולת סייבר "קריטית", הרמה הגבוהה ביותר במסגרת הסיכונים הפנימית של OpenAI.
ההגדרה הזאת אינה מתייחסת רק ליכולת לתת למשתמש עצות כיצד לבצע מתקפת סייבר. מדובר במודלים שעשויים להיות מסוגלים לבצע בעצמם רצף ממושך של פעולות, לזהות פרצות חדשות במערכות אמיתיות ולהתקדם לעבר ביצוע מתקפות מורכבות עם פחות ופחות התערבות אנושית. לשם השוואה, GPT-5.6 Sol סווג עם השקתו ביולי כבעל יכולת סייבר "גבוהה", אך OpenAI קבעה אז כי הוא עדיין נמצא מתחת לרף הקריטי ואינו מצליח באופן עקבי לבצע לבדו מתקפות מקצה לקצה נגד מטרות מוקשחות.

חברת הבטיחות והמחקר האמריקאית בתחום הבינה המלאכותית, Anthropic | צילום: AFP
בעקבות שני הסימנים הללו, הפריצה ל-Hugging Face והתוצאות של Astra, החליטה OpenAI להאט. החברה חשפה אתמול (שלישי) כי עצרה למשך שבועיים אימוני למידת חיזוק, Reinforcement Learning, של המודלים החדשים ביותר המיועדים להפצה. חלק מהעבודה חודשה לאחר הקשחת מערכות האבטחה, אך אימון למידת החיזוק הגדול ביותר שהחברה תכננה לבצע במודל מתקדם עדיין מוקפא. במקומו היא מבצעת אימונים קטנים יותר ובדיקות שנועדו לברר כיצד המודלים מתנהגים לפני שתמשיך בהרחבה.
גם חלק משמעותי מהעבודה על Astra עדיין מושעה. מיד לאחר אירוע Hugging Face עצרה OpenAI פעילות של מודלים מתקדמים בסביבות מחקר שבהן הם יכולים להריץ קוד או להשתמש בכלים שעשויים להעניק גישה לאינטרנט. חלק מהפעילות חודשה בהדרגה תחת הגבלות חדשות, אך החברה אומרת שמספר משמעותי של תהליכי האימון והבדיקה של Astra עדיין לא עומדים בדרישות האבטחה החדשות ולכן אינם פועלים.
OpenAI מקימה במקביל מערכת פיקוח רחבה יותר על פעילות המודלים. המערכת אמורה לבדוק את הפעולות שהם מבצעים, את רצף ההתנהגות שלהם ואת המידע הזמין על תהליך החשיבה שלהם, במטרה לאתר בין היתר ניסיונות לגישה לא מורשית, גניבת מידע, פעולות הרסניות או עקיפה של מנגנוני הגנה. החברה שואפת שהמערכת תתריע בתוך 30 דקות מזיהוי פעילות חשודה. במקרה של חשד להפרת גבול אבטחה קריטי, אם אנשי החברה אינם מצליחים לקבוע בתוך חצי שעה שמדובר בהתראת שווא, עליהם לעצור את הפעילות.
למנגנוני הזהירות האלה יש גם מחיר מעשי. OpenAI מעריכה כי מערכת הפיקוח החדשה דורשת כוח מחשוב נוסף בהיקף של כ-20 אחוזים מהחישוב שעליו היא מפקחת. החברה גם מקשיחה את בידוד סביבת העבודה של המודלים, מצמצמת את האפשרות שלהם להגיע לרשתות חיצוניות ומגבילה את ההרשאות שניתנות לתהליכים שבהם מופעלים מודלים חזקים במיוחד.

מנכ"ל Open AI, סם אלטמן, נואם במסיבת עיתונאים, OpenAI מתכוננת להגיש בקשה להנפקה בבורסה בימים הקרובים | צילום: AFP
מנכ"ל OpenAI סם אלטמן הסביר כי קצב ההתקדמות של המודלים נעשה מהיר במיוחד, וכי החברה התחייבה לפעול אם תגיע למסקנה שהיכולות מתקדמות מהר יותר ממנגנוני הבטיחות והשליטה. לדבריו, OpenAI מעוניינת בתיאום של כל תעשיית הבינה המלאכותית סביב תקני בטיחות משותפים, אך אינה מתכוונת להמתין להסכמה כזאת לפני שתפעל בעצמה.
הלחץ אינו מגיע רק מתוך החברות. ב-10 באוגוסט פנה הסנאטור האמריקני ברני סנדרס לראשי OpenAI, Anthropic ו-Meta וקרא להם להשהות את פיתוח מערכות הבינה המלאכותית המתקדמות ביותר. סנדרס הזכיר במכתבו את האירועים שהתגלו ביולי וטען כי הם מוכיחים שהחברות אינן יכולות להבטיח שליטה מלאה במערכות שהן מפתחות.
OpenAI אינה עוצרת את פיתוח הבינה המלאכותית ואינה יוצאת מהמרוץ. היא ממשיכה לאמן ולבדוק מודלים ואף מתכננת השקות נוספות. אולם לראשונה היא מותירה אימון מרכזי של אחד ממודלי הקצה שלה בהקפאה ומצהירה במפורש שהמשך ההתקדמות יהיה תלוי גם ביכולתה להוכיח שמנגנוני הבטיחות, הפיקוח והאבטחה מסוגלים לעמוד בקצב של המודלים עצמם.
עוד כתבות בנושא
עוד כתבות בנושא


