Anthropic השיקה אתמול (22.9.26) בספטמבר את Claude Opus 5.5, הדגם הראשון במשפחת Claude 5.5 והמודל המוביל החדש שלה. לפי החברה, המודל מציג שיפור משמעותי במשימות פיתוח תוכנה, שימוש במחשב ועבודה מבוססת סוכנים, ובמקביל עולה כ-40% פחות להרצה בעומסי עבודה טיפוסיים לעומת Opus 5. המודל זמין כבר בפלטפורמה של Anthropic וגם דרך Amazon Web Services, Google Cloud ו-Microsoft Azure.
ההשקה מעניינת במיוחד מפתחים וארגונים שמפעילים תהליכי AI ארוכים ומרובי שלבים. Anthropic טוענת כי Opus 5.5 לא רק זול יותר במחיר לטוקן, אלא גם משתמש בפחות טוקנים כדי להשלים משימות. מחיר ה-API נקבע על 4 דולר למיליון טוקני קלט ו-20 דולר למיליון טוקני פלט, ירידה של 20% לעומת Opus 5. קריאה מהמטמון, רכיב משמעותי בעבודות קוד וסוכנים, הוזלה ל-0.20 דולר למיליון טוקנים.
הדגש המרכזי הוא פיתוח תוכנה וסוכני AI
במבחנים שפרסמה Anthropic, Opus 5.5 הגיע ל-66.4% ב-Terminal-Bench 4.0, מבחן למשימות מקצועיות מורכבות בסביבת שורת פקודה, ול-54.4% ב-FrontierCode v1.1. החברה מדגישה כי הפער החשוב מבחינתה אינו רק בציון, אלא ביחס בין ביצועים לעלות. לפי Anthropic, במבחני קוד מסוימים המודל השיג תוצאות ברמה של מודלים מתחרים או גבוהה ממנה, בעלות נמוכה משמעותית למשימה.
גם בדיקות מוקדמות בסביבות אמיתיות מצביעות על שינוי אפשרי באופן שבו צוותי פיתוח ישתמשו במודלים מתקדמים. Anthropic מתארת מקרה שבו בוצעה ביקורת ותיקון של בסיס קוד בהיקף 200 אלף שורות בפחות משלוש שעות, לעומת יותר מ-20 שעות עם Opus 5. במקרה אחר, המודל השלים הסבה של בסיס קוד בן 680 אלף שורות בתוך פחות מיום. אלה נתונים שמגיעים מהחברה ומבודקים מוקדמים, ולכן אינם תחליף לבחינה עצמאית בסביבת ייצור.
יותר יכולות, וגם יותר מגבלות אבטחה
השיפור ביכולות מגיע יחד עם מנגנוני הגנה מחמירים יותר. Anthropic מסרה כי Opus 5.5 נבדק לפני ההשקה גם על ידי גופים חיצוניים, בהם METR ו-Frontier Design. החברה מפעילה על המודל הגנות מיוחדות בתחומי סייבר וביולוגיה, וחלק מבקשות הסייבר ינותבו למודל אחר. במקביל, היא מתכננת להרחיב תוכנית אימות שתאפשר לאנשי סייבר מאושרים גישה רחבה יותר ליכולות המודל.
לפי Reuters, Anthropic מציגה את Opus 5.5 כמודל החזק ביותר שלה עד כה, בזמן שהתחרות בין ספקיות ה-AI עוברת בהדרגה משאלה של מי משיג את ציון הבנצ'מרק הגבוה ביותר לשאלה רחבה יותר: כמה עבודה שימושית ניתן להשלים בכל דולר ובאיזו מהירות. עבור ארגונים שמריצים סוכנים, כלי פיתוח ותהליכי אוטומציה בהיקף גדול, היחס הזה עשוי להיות משמעותי לא פחות מהיכולת המקסימלית של המודל.
Anthropic הודיעה כי Claude Sonnet 5.5 ו-Claude Haiku 5.5 צפויים להגיע בשבועות הקרובים. אם גם הם יקבלו שיפורים דומים ביעילות ובעלות, משפחת 5.5 עשויה להרחיב את הלחץ על ספקיות המודלים להתחרות לא רק באיכות, אלא גם בעלות הכוללת של הפעלת מערכות AI בעולם האמיתי.

