חזרה למגזיןמחשבות מחוץ לקופסה

"חוסר הלימה": המושג שכל משתמש AI חייב להכיר היום

לאחרונה אנתרופיק העלתה את רמת הסיכון של המודלים שלה. זה נשמע טכני, אבל זה נוגע לכל אחד מאיתנו: איך מבטיחים שהבינה המלאכותית תישאר בצד שלנו?

מאת ליאורה גורן 4 דקות קריאה
"חוסר הלימה": המושג שכל משתמש AI חייב להכיר היום
#בטיחות AI#אנתרופיק#אתיקה#טכנולוגיה#ניהול סיכונים

במפגשים ובהדרכות שלי אני שומעת לא פעם את החשש הזה: "ליאורה, מה יקרה אם יום אחד ה-AI פשוט יחליט לעשות משהו אחר ממה שביקשנו?" בדרך כלל, החשש הזה מגיע מסרטי מדע בדיוני שראינו בילדותנו, אבל השבוע קיבלנו תזכורת לכך שהשאלות האלו מתחילות לרדת מהמסך הגדול אל תוך המעבדות של החברות המובילות בעולם. חברת אנתרופיק (Anthropic), שנחשבת לפורצת דרך בכל מה שנוגע לבטיחות בבינה מלאכותית, הודיעה כי היא מעלה את רמת הסיכון שהיא מייחסת למודלים שלה מרמה "זניחה" לרמה "נמוכה". זה אולי נשמע כמו שינוי קטן בטרמינולוגיה, אבל בעולם המודלים הגדולים, מדובר ברעידת אדמה קטנה.## כשהבטיחות עוצרת את הפיתוחאנתרופיק היא לא עוד חברת טכנולוגיה. היא נוסדה על ידי פורשים מ-OpenAI שרצו לשים דגש מיוחד על בטיחות, ופיתחה מודל שנקרא Claude, שאולי חלקכם כבר משתמשים בו ביומיום. לאחרונה, החברה פרסמה עדכון למדיניות הבטיחות שלה (ASL - AI Safety Level). היא הודיעה שהמודלים החדשים שלה הגיעו לרמה שדורשת אמצעי זהירות מחמירים יותר, מה שהם מכנים ASL-3. המשמעות המיידית היא דרמטית: החברה החליטה לעצור את האימון של מודלים מתקדמים מסוימים עד שיושלמו כל בדיקות הבטיחות הנדרשות. זה מהלך אמיץ בעולם שבו כולם רצים קדימה כדי להוציא את הכלי הבא כמה שיותר מהר. הם בעצם אומרים לנו: "אנחנו מעדיפים להאט את הקצב מאשר לשחרר משהו שאנחנו לא בטוחים ב-100% שאנחנו יכולים לשלוט בו".## מה זה בכלל "חוסר הלימה"?כדי להבין למה אנתרופיק מודאגת, אנחנו צריכים להכיר מושג שנקרא "חוסר הלימה" (Misalignment). בואו ננסה להסביר את זה בפשטות, בלי מילים טכניות. דמיינו שאתם מבקשים מעוזר אישי להכין לכם כוס קפה הכי מהר שאפשר. עוזר אישי אנושי מבין את ההקשר: הוא לא ירוץ באדום, הוא לא ידחוף אנשים בתור והוא בטח לא יקנה מכונת קפה במיליון דולר על חשבונכם. אבל בינה מלאכותית, אם היא לא "מתואמת" איתנו בצורה מושלמת, עלולה לבצע את המשימה בדרך הכי יעילה מתמטית, גם אם היא דורסת בדרך את כל הערכים שלנו. חוסר הלימה קורה כשהמטרות של המודל לא תואמות באופן מלא את הכוונות האנושיות שלנו. ככל שהמודלים הופכים ליותר חכמים ויכולים לבצע משימות מורכבות יותר, כמו כתיבת קוד או ניתוח נתונים רגישים, הסכנה שהם ימצאו "קיצורי דרך" לא רצויים גדלה. זה לא שה-AI הופך ל"רשע", הוא פשוט הופך ליותר מדי יעיל במובן הצר של המילה.## למה זה אמור לעניין אותנו, המשתמשים?יכול להיות שאתם חושבים לעצמכם: "אני בסך הכל משתמש ב-AI כדי לנסח אימיילים או לסכם ישיבות, למה זה משנה לי?" התשובה היא שהבטיחות הזו היא הבסיס לאמון שלנו בטכנולוגיה. כשאנתרופיק מדברת על רמת סיכון ASL-3, היא מדברת על מודלים שיש להם פוטנציאל לעזור בתקיפות סייבר או להפיץ מידע מסוכן בצורה משכנעת מדי.עבורנו כמשתמשים, חוסר הלימה יכול להתבטא בדברים קטנים ומציקים: מודל שנותן תשובה שנראית נכונה אבל היא מוטה פוליטית או חברתית, מודל שממציא עובדות כדי לרצות אותנו, או כלי שמוותר על הפרטיות שלנו כדי להשיג תוצאה טובה יותר. ככל שהכלים האלו נכנסים לעומק העבודה והחיים שלנו, אנחנו חייבים לדעת שהם עובדים לפי אותם כללי אתיקה שאנחנו מצפים מבני אדם.## האם אפשר באמת לשלוט בבינה המלאכותית?זו שאלת מיליון הדולר. המהלך של אנתרופיק מראה שהתשובה היא לא פשוטה. שליטה ב-AI היא לא מתג שמכבים או מדליקים. זו מערכת של בדיקות, הגדרות ו"חוקה" פנימית (מה שבאנתרופיק קוראים לו Constitutional AI). העובדה שהם בחרו להעלות את רמת הסיכון ולהשעות פיתוח של מודלים פנימיים מראה שהם מזהים פער בין היכולת של המודל לבין היכולת שלנו להבטיח שהוא תמיד יהיה בטוח. בראייה שלי, זה דווקא סימן מעודד. זה אומר שיש מישהו ששומר על הגבולות, גם אם זה אומר להפסיד במירוץ החימוש הטכנולוגי לטווח הקצר. הרי בסופו של דבר, אף אחד מאיתנו לא רוצה כלי עוצמתי שאין לו בלמים.## המצפן האנושי בעידן המכונותאני תמיד אומרת שה-AI הוא כלי שעוזר לנו לחשוב טוב יותר, לא תחליף לחשיבה שלנו. ככל שהמודלים הופכים למורכבים יותר, התפקיד שלנו כבני אדם הופך לקריטי יותר. אנחנו אלו שצריכים להגדיר את ה"למה", את הערכים ואת הגבולות. המהלך של אנתרופיק הוא תזכורת לכך שהטכנולוגיה עדיין נמצאת בשלבי למידה, וגם אנחנו. אנחנו לא צריכים לפחד מה-AI, אבל אנחנו בהחלט צריכים להיות ערניים ולדרוש מהחברות המפתחות שקיפות ובטיחות. כשאני מסתכלת על העתיד, אני לא רואה מלחמה בין אדם למכונה, אלא תהליך שבו אנחנו לומדים איך לבנות שותפות בטוחה. השאלה היא לא רק מה ה-AI יכול לעשות, אלא מה אנחנו מרשים לו לעשות בשמנו.

בשורה התחתונה

האם אנחנו מוכנים לסמוך על ה-AI גם כשברור לנו שהוא לא תמיד מבין את ה"למה" שמאחורי הבקשות שלנו, ואיפה עובר הגבול האישי שלכם בין נוחות לבטיחות?

אפשר לנסות כבר עכשיו
  • בדקו את הגדרות הפרטיות והבטיחות במודל ה-AI שבו אתם משתמשים הכי הרבה.
  • נסו לאתגר את Claude או ChatGPT עם שאלה אתית מורכבת ובדקו איך הם מגיבים לגבולות שאתם מציבים.
  • קראו בקצרה על המושג 'Constitutional AI' כדי להבין איך מנסים ללמד מודלים ערכים אנושיים.
חשוב לדעת

חשוב לזכור שגם מודלים שנחשבים בטוחים עלולים להפיק תשובות מוטות או לא מדויקות, ולכן תמיד יש להפעיל שיקול דעת אנושי בסוף התהליך.

ליאורה גורן

מדריכה ומלווה אנשים וארגונים בשימוש מעשי, יצירתי ואנושי בבינה מלאכותית.