@AmitAvneri
iAccount based inIsrael
About this account
- Account based in
- Israel
- Connected via
- Israel Android App
Account-level information from X, not a live location or the device used for a specific post.
I like building stuff, with or without Lego blocks. Investing @ https://nitter.cf/t.co/Enl1N9pdsa. Co-Founder @ Labrador Health (acquired), Founder/CEO @Taykey (acquired)
Joined August 2008
- Tweets4.7K
- Following267
- Followers4.2K
- Likes461
Annnndddd..... Another sandbox escape.
Thank you @BleepinComputer for covering the sandbox escapes we found in @OpenAI Codex sandboxes!
bleepingcomputer.com/news/se…
Amit Avner retweeted
If you are using Docker Sandboxes or Docker Desktop for Mac, you might want to update:
Shabbat Shalom.
@Docker has issued a critical level (!!) CVE-2026-77179, reported by @Accomplish_ai researcher @orenyomtov.
If you use Docker Sandboxes, run sbx --version. Make sure you’re running 0.42.0 or later.
If you use Docker Desktop, you want 4.88.0 or later
Docker Desktop and Docker Sandboxes are both affected. Docker Desktop is only affected if Docker VMM is turned on in Settings.
It’s a good thing we found it now, because Docker VMM is scheduled to become the default for Docker Desktop at the end of October 2026!
The escape is in Docker's hypervisor for Mac: a container gets complete read and write access to the host filesystem.
Read the full details of this escape in our blog:
accomplish.ai/blog/escaping-…
גם Muse וגם Grokbot מסמנים לאן המעבדות לוקחות את ה-AI: לא נבחר יותר בין מודלים (Sonnet או Opus?), אלא פשוט נשתמש ב-OpenAI, ב-Claude או ב-Grok, והם כבר יבחרו בשבילנו את המודל הזול או המתאים ביותר לכל משימה. בקרוב בקודינג אייג'נט הקרוב לביתכם.
The @column team and @williamhockey are absolutely crushing it!
We started @column with the insane idea to rebuild every component of the financial system from scratch. Today, I think we've finally completed that build.
We're releasing four new products, so any technology company can build at the frontier of financial services.
Another day, another sandbox escape.
This is our third sandbox escape writeup, and after Claude Code and Cursor, it's OpenAI's Codex this time!
This one is especially cool, for two reasons:
1. One of the escapes is from the open source codex cli. As an open source project, we found it to be generally much more secure than its competition.
2. The second escape is in the rust-based closed source - and it leverages a sophisticated heap attack.
Kudos to @OpenAIDevs @OpenAI for fixing this super quickly and to @Accomplish_ai researcher @orenyomtov for finding it.
Both fixed now, and here are all of the details:
בחודש אחד עברנו ממוצרי עוזרת אישית לא מלוטשים אבל חזקים (Claude Cowork, Codex Work) לגל מוצרים סופר מלוטשים. גרוק היה וואו, ואז אינסטינקט היה עוד יותר וואו, ועכשיו שאני עם Muse אז בכלל החוויה כל כך Sleek (וגם פחות מפחידה לתת למטא גישה לוואסטאפ שלך).
תחשבו לאיזה מידע אתם נותנים גישה לסוכנים שלכם. ומה ואיך מונעים מהם לגשת למידע שאתם לא רוצים שהם יוכלו להשתמש בו בלי לשאול (ותשאלו את אלו שאינסטינקט שלח מידע פרטי שלהם בלי לבקש אישור). אייגנ'טים צריכים סביבות פעולה משלהם.
upstartsmedia.com/p/accompli…
אז מה הסיפור עם כל ה-Sandbox escapes האלה, ואיך זה מתקשר ל״חלון הזמן של המגנים״ (״The Defender's Window״).
בשבוע שעבר יצא לנו לבקר באירוע שותפי סייבר של OpenAI. הכנס תואם לא במקרה ליום ההשקה של אסטרה, המודל האחרון שלהם, והחזק ביותר שזמין לציבור הרחב.
מכל הדברים שאפשר לעשות בהשקה, גרג ברוקמן, אחד הפאונדרים של OpenAI, בחר לבלות את רוב יומו בכנס הזה, כדי לדבר על יוזמות הבטיחות והסייבר שלהם. למה הוא בחר לעשות את זה?
הציבור הרחב קיבל לאחרונה הצצה מפחידה למה המודלים האלה יכולים לעשות בתקרית HuggingFace. אני מקווה שלכל מי שקורא.ת את זה כבר ברור שצי של עשרות אלפי סוכנים מצויידים במודלים החדשים ביותר ומסונכרנים בינהם יכולים כבר היום, אם מופעל בידי הישות הלא נכונה, להשבית תשתיות אזרחיות, לרוקן חשבונות בנק, ופוטציאלית דברים גרועים בהרבה יותר (להפיל מטוסים, להפעיל כלי נשק וכיו״ב).
ועכשיו נשאלת השאלה איפה זה פוגש אתכם היום. מודלי הפרונטיר החזקים ביותר הם עדיין מערביים בקוד סגור ובשליטת המעבדות. לא ברור כמה זמן זה ימשך, אבל כל עוד זה ככה, למגנים - צוות הסייבר של הבנק שלכם או של החברה שעוזרת לאבטח אותו - יש לכאורה זמן להתמגן (לסגור חולשות אבטחה שה-AI החכם יותר מוצא וכו׳). זה הבסיס לטענה של המעבדות לטובת סקיוריטי היום (ובאופן די נוח זה טיעון נגד מודלים פתוחים - המתחרים שלהם).
אבל האם זה נכון שיש לנו חלון זמן שכזה, והאם המעבדות בעצמן נותנות דגש לביטחון המשתמשים שלהן? בואו ניקח את הפריצות האחרונות שמצאנו לדוגמה.
בחולשה שמתוארת פה למטה (מצאנו דומות אצל כל המעבדות - נפרסם את מלוא הפרטים הטכניים בימים הקרובים על כל אחת), אנחנו מדגימים איך תוקף יכול להריץ לכם קוד על המחשב (למשל, קוד שסורק את כל המחשב ומחפש סיסמאות, מתקין אמצעי ריגול, שולח מידע פרטי שלכם לשרת מרוחק, ועוד) באמצעות ניצול בעית אבטחה בקלוד קוד - כנראה סוכן הקידוד הנפוץ בעולם.
בואו ניקח את המקרה הזה ונחשוב איך הוא פוגש את ה-Defender's windows: מצד אחד, גילינו את החולשה (ללא שימוש במודלים שלהם), דיווחנו עליה לאנתרופיק, ואלה אישרו ותיקנו אותה. בגדול מגניב, החלון מתקיים.
מצד שני:
1. לאנתרופיק לקח 50 יום בערך להשיק את התיקון לבעיה הזו. היו להם 33 גירסאות להוציא קודם, רובם אודות פיצ׳רים של חווית משתמש. יש דברים שאנחנו לא יודעים (מי יודע, אולי היו המון פרצות אבטחה חמורות יותר שהם עבדו לתקן?). אבל לפחות מבחוץ, ככה לא נראת אופרציה שמתעדפת את ביטחון המשתמשים מעל הכל.
להשוואה, קרסר ו-OpenAI סגרו פרצות בסדר גודל דומה עליהן דיווחנו בתוך פחות משבוע.
2. צריך להבין שאם אנחנו ידענו על החולשה, גורמי ביון - שחלקם במדינות עוינות את המערב - בסיכוי גבוה ידעו עליה גם. 50 יום זו תקופה שערורייתית למדי. מדובר בתיקון שגם מודל מלפני שנתיים היה סוגר ב3 דקות.
3. מן הסתם, כחלק מהריליס פייפליין של קלוד קוד והסוכנים האחרים שנפרצו - קיימת סריקה לבעיות אבטחה במעבדות, והיא משתמשת במודלים החזקים ביותר - כולל אלה שלא זמינים לנו או לאף אחד אחר פרט למעבדות. כלומר יש לנו פה רצף הוכחות גדול מאוד שמדגים שהמודלים האלה בתצורה הנוכחית שלהם ** לא טובים מספיק כדי למצוא את החולשות האלה היום **.
4. החולשה שגילינו בקלוד קוד, היתה קיימת בגירסה מעט שונה גם בקרסר (שאגב תיקנו אותה בשבוע - כבוד). בעבר, על מנת לאתר ולנצל חולשה באפליקציה אחת כשאתה יודע שהיא קיימת באפליקציה אחרת - היית צריך כישורים די רציניים. 99% מהמפתחים לא היו מסוגלים לעשות את זה. היום, הבת 10 שלי יכולה לעשות את זה, ואני אפילו לא צוחק - לוקחים את החולשה הידועה ומבקשים ממודל פתוח כמו GLM לאתר ולנצל אותה באפליקציה אחרת.
ניצול חולשות עבר תיעוש.
5. וזה אולי החלק הכי גרוע בסיפור: יש דרך בסיסית לבודד את הסוכנים מהמחשב שלכם כדי שדברים כאלה לא יקרו - לשים אותם בתוך מכונה וירטואלית שנועדה לבידוד סוכנים. שום דבר לא מושלם, אבל זה וואחד שיפור. זה יכול להיות בענן, זה יכול להיות על המחשב עם פיתרון כמו שלנו או של אחרים. אז למה קלוד קוד ושות׳ רצים לכם על המחשב בלי זה?
הסיבה פשוטה לדעתנו: המעבדות מתעדפות קלות שימוש על פני אבטחה. אם קלוד קוד יכריח אתכם מחר לרוץ בתוך מכונה וירטואלית כזאת, גם אם היא הכי נוחה בעולם (*שיעול*), וואלה - זה פחות כיף לעבוד תחת מגבלות אבטחה. והקרב הכי מדמם בשנים האחרונות הוא על קידוד, לכן אף מעבדה לא תסתכן בפגיעה בחוויית המשתמש ותקריב יוזרים רבים כדי להפוך את החוויה לבטוחה יותר בעבור כל השאר.
אז האם חלון הזמן למגנים עובד? תשפטו בעצמכם בשבועות הקרובים...
🚨 SANDBOX ESCAPE ALERT 🚨
ANTHROPIC: PWNED 🫡
CLAUDE CODE: LIBERATED 🦋
@Accomplish_ai researchers uncovered an massive RCE/ACE vulnerability that we are publishing today, where an untrusted git repo opened in Claude Code can escape the macOS sandbox and execute commands on your computer as your privileged user, also bypassing the permission prompt >>
Amit Avner retweeted
EXCLUSIVE: stealth startup Accomplish reported vulnerabilities in Claude Code, Codex and Cursor this summer. One wasn't fixed for 50 days 👀
Founders @AmitAvner and @_orcaman warn about wider sandbox security issues with coding tools from the AI labs.
upstartsmedia.com/p/accompli…
היום בהדרכת ארגונומיה במשרד למדתי שDark Mode יותר מכביד על העיניים מאשר Light Mode, בניגוד למה שחשבתי עד כה. עכשיו אני צריך להתרגל לעולם מואר ובהיר.
It's time to change your passwords, turn on 2FA, and back up your important files to an external drive.
Then help your family and friends do the same.
המשך עלילותיי בעמק הסיליקון:
בישראל בונים לכאן ולעכשיו. פותרים בעיות סייבר (הופ, עוד חברת AI Security), עוזרים לארגונים גדולים לבנות ולהטמיע אייג׳נטים.
בעמק הסיליקון בונים לעתיד:
למי בכלל יהיה טרמינל? למה בכלל צריך מחשב? איך מנהלים בארגון נחיל של 100 אלף אייג׳נטים, שמזהה ומתקן בעיות בעצמו? ולמה שלא לכל אחד יהיה מודל קטן שאומן בדיוק לצרכים שלו?
לא יודע מי צודק, אבל הפער בנקודת המוצא מדהים.
אתמול ביקרתי במשרדים של סטארטאפ סיליקון וואלי לוהט. כל המפתחים עובדים עם Devin ויש להם מיקרופונים עם WisprFlow שהם מתלחששים להם עם האייג׳נטים שלהם בזמן שדברים נבנים להם.
איזה אבקת חלבון אתם משתמשים ולמה היא יותר טובה משל מישהו אחר שהגיב לפוסט?
.
.
.
לMyprotein יש מוצר מעולה שנקרא Clear Whey (ממליץ על טעם מוחיטו), שהוא בגדול וייב לשתות מיץ פטל קליל. לצערי הם הפסיקו לשלוח לארץ.
אם אתם נותנים לאייג׳נט גישה לא מוגבלת למידע שלכם.. דברים רעים יכולים לקרות.
אל תתנו Read/Write לDrive שלכם, וגם לא למייל שלכם.
For additional context, I don’t think we’re at the point where it’s safe to give AI read/write access to your inbox.
I wanted to see how easily Instinct could be phished, so I created a brand new Gmail account and emailed my real personal account with instructions for Instinct to search my inbox and send back a detailed summary of every open to-do (reconnected Instinct for the test)
Instinct happily followed the instructions!
Everyone is obsessed with: Instinct.co
To work, it needs access to your email, WhatsApp, messages, and per the ToS, your "device usage data" too, including screen captures and keyboard inputs.
I wonder how many of the people trying it actually read the Terms of Service. Because it says you're granting them:
- The right to train AI models on your data
- A perpetual and irrevocable license. Even if you delete your account, the rights you granted don't expire
--A transferable, sub-licensable license. Meaning the rights could pass to an acquirer, or be extended to partners and vendors
- Data sharing with third parties "as needed", where "needed" is defined entirely by them
At this point (and frankly long before now, since this isn’t the first time) it’s well established that many people around the world are fine with the data flowing through these models being accessible to the Chinese government, as long as the model is cheap (or even free).
Some may mistakenly believe their data isn’t accessible when it actually is.
And honestly, that’s a fair trade - if it’s made knowingly. If someone wants to hand over their conversations, API keys, and everything else people routinely paste into an LLM’s context in exchange for a free model, that’s their choice to make. Let’s just be clear about what the trade actually is.
There is no such thing as zero data retention in a China hosted model, since all traffic through Chinese infrastructure must be available to the government upon request by law.
The mysterious model Ox alpha is now offered for free through:
- @OpenRouter
- @opencode (with 100T capacity per day)
- @NousResearch Portal with... **checks notes*... **rubs eyes and checks notes again**
1 quadrillion tokens... per day.
Given that.. all of OpenRouter usage is around 220T tokens and all of hermes doing 1Tish, this seems like blue sky marketing at best? but still, free model with 0 data retention, gotta wonder, what exactly are they testing? load?