האם הייתם מכנים אימון של מודלי שפה גדולים על תוכן בהיקף של האינטרנט כולו "גניבה בקנה מידה בלתי נתפס וחסר תקדים"? או שאולי אתם מעדיפים את הניסוח "גניבת העבודה הגדולה ביותר בתולדות האנושות"?

תבחרו. שני הניסוחים האלה – ועוד רבים אחרים – מופיעים במסמך משפטי חדש שפורסם ללא חלק מההשחרות שהסתירו עד כה את תוכנו, במסגרת התביעה המתנהלת של הניו יורק טיימס נגד OpenAI ומיקרוסופט. את הבקשה הגישה קבוצת הוצאות לאור בהובלת הניו יורק טיימס. אלא שהניסוחים החריפים ביותר לא נכתבו בידי עורכי הדין של הטיימס, אלא בידי בכירים ב-OpenAI ובמיקרוסופט עצמן.

"מיליוני אנשים ברחבי העולם יראו בקרוב במודלים הגדולים ש'שואבים' את כל העבודה שלהם גניבה בקנה מידה בלתי נתפס וחסר תקדים", כתב ברנט הכט, מנהל תחום המדע היישומי במיקרוסופט, במסמכים שנחשפו. "כמעט אף אחד לא התכוון לכך שהתוכן שיצר ישמש באופן הזה, והם גם לא מקבלים אף תמורה על השימוש בו", כתב.

בהצהרה שנשלחה בדוא"ל מסר דובר מיקרוסופט כי דבריו של הכט "משקפים את נקודת המבט האישית של עובד אחד, אינם ניתוח משפטי ואינם מייצגים את עמדת החברה".

חברות הבינה המלאכותית טוענות בפומבי כי השימוש בתוכן לצורך אימון המודלים שלהן חוסה תחת הדוקטרינה המשפטית של "שימוש הוגן". הוצאות לאור, לעומת זאת, מזהירות כבר זמן רב כי התוכנית של חברות ה-AI להשתמש בתוכן ללא תשלום תפגע קשות בתעשיית החדשות – אותה תעשייה שעבודתה משמשת לאימון המודלים האלה. כעת מתברר שלפחות חלק מהאנשים בתוך תעשיית ה-AI מסכימים עם ההערכה הזאת.

בתכתובות פנימיות במיקרוסופט זוהה "סיכון ממשי" לכך שבינה מלאכותית גנרטיבית "תשבש באופן משמעותי את העסקתם של אותם אנשים עצמם שיצרו את הנתונים שעליהם אומן מודל הבסיס". במסמך מדיניות אחר נוסחה הבעיה כך: "מודלי שפה גדולים הם מוצר שהורס את שרשרת האספקה שלו".

לפי מסמך פנימי אחר של מיקרוסופט, הגישה הנוכחית יצרה "מעגל הרסני".

"אסטרטגיית התוכן שלנו בתחום הבינה המלאכותית התניעה 'מעגל הרסני' שיפגע בעת ובעונה אחת בביצועי המודלים שלנו ובאינטרנט כולו", נכתב במסמך. "זה חריג מאוד שמוצר קצה מאיים על היסודות הכלכליים של הספקים החיוניים לו, אבל זה המצב שיצרנו בעסקי מודלי השפה הגדולים שלנו בכל הנוגע ל'שרשרת אספקת התוכן' שלהם".

במקום אחר הודה ניק טרלי, ראש ChatGPT ב-OpenAI, כי המו"לים ניצבים בפני "איום קיומי" מצד מוצרי החברה. כלי ה-AI, כתב, "הם במידה רבה תחליף, נקודה", והם "יהפכו יותר ויותר לתחליף ככל שישתפרו".

נשיא OpenAI והמייסד-השותף שלה, גרג ברוקמן, כתב לעמיתיו: "אגב, אנחנו מצוינים בחדשות. בכל פעם שאני עושה משהו גנרטיבי עם הניו יורק טיימס, נראה שהוא מצליח לנבא לא רע את המשפט הבא". ברוקמן כתב גם שהמודל של OpenAI "נראה מוצלח במיוחד בניבוי טקסט של כתבות חדשות. למשל, בכל פעם שאני מבקש ממנו להשלים טקסט באמצע משפט בכתבה של הניו יורק טיימס, נראה שהוא משלים את המשפט בצורה די מדויקת".

המסמך המשפטי מראה גם שעובדי OpenAI התאמצו לעקוף חומות תשלום של אתרי חדשות כדי לשאוב מהם תוכן. כשסיפרו לברוקמן על "טריק לעקוף את חומת התשלום של הניו יורק טיימס", הוא השיב: "אה, יפה".

בעבר הושחרו חלקים נרחבים מההתבטאויות האלה או שהמסמכים שבהם הופיעו נותרו תחת חיסיון. חלקים מסוימים עדיין חסויים.

"קל להבין למה חברות ה-AI כל כך רצו להשחיר את המסמכים האלה", כתב מנכ"ל Digital Content Next ג'ייסון קינט, שהיה הראשון לשתף ב-X את המסמכים שנחשפו במלואם. "האנשים שלהן עצמם כתבו את הפתיח בשביל הניו יורק טיימס".

את מסמכי בית המשפט אפשר לקרוא כאן.

המאמר התפרסם במקור ב-18 בספטמבר באתר "נימן לאב" של אוניברסיטת הארוורד והוא מובא כאן בהתאם לרישיון השימוש של התכנים באתר