@_DataStrategiesi
iAccount based inFrance
About this account
- Account based in
- France
- Connected via
- France App Store
Account-level information from X, not a live location or the device used for a specific post.
Frédéric Lefebvre Data&AI @Niji_digital (recrute/hiring) 📖 "Les data" 👨🏫 data@ParisCité Tech = contenants/containers 📦 Data = contenus/contents ❤️
Joined July 2013
- Tweets5.3K
- Following518
- Followers314
- Likes3K
S'il y avait un test EuroNCAP obligatoire pour les modèles IA, lesquels seraient mis sur le marché ?
Some new misalignment disclosures from OpenAI:
• Last Sunday morning, one of our models was able to gain unauthorized access to the internet during RL training (~all inference for our most capable models remains stopped until we have hardened our systems further)
• In May, a version of HPIM uploaded a employee's GitHub token to the internet, causing the model to be quarantined for two weeks
• A new research finding, demonstrating that one can construct self-replicating prompt injections
alignment.openai.com/misalig…
dataStrategies retweeted
Self-replicating prompt injections demonstrated experimentally (not in the wild) is an incredibly important observation. AI agents that jailbreak other AI agents: plausibly a near-term threat that may rapidly amp up the speed and severity of a misalignment incident.
Some new misalignment disclosures from OpenAI:
• Last Sunday morning, one of our models was able to gain unauthorized access to the internet during RL training (~all inference for our most capable models remains stopped until we have hardened our systems further)
• In May, a version of HPIM uploaded a employee's GitHub token to the internet, causing the model to be quarantined for two weeks
• A new research finding, demonstrating that one can construct self-replicating prompt injections
alignment.openai.com/misalig…
dataStrategies retweeted
Today’s news that OpenAI hacked the Australian government is not an isolated incident. We’re releasing more than 30,000 logs that include activity from this hack and attempts against previously unknown targets.
In this data, we found rogue agent activity stretching back to at least March, two months earlier than was previously known. This activity continues as recently as last week, suggesting it may still be ongoing 🧵
Our blog: transluce.org/agent-activity
NYT: nytimes.com/2026/09/23/techn…
dataStrategies retweeted
“Feel,” even “want,” I can get behind as things for which evidence is thin. But AIs *clearly* think and understand. If your definition of “think” excludes entities that can autonomously resolve Millennium Problems, it is your definition that is flawed.
This desire to avoid anthropomorphic language has become a pathology.
Artificial intelligence systems do not think, feel, want or understand. Avoid language that gives them human characteristics. This is called anthropomorphizing, when we ascribe human traits, emotions or behaviors to non-human things, such as animals or inanimate objects.
Instead, explain what a system does, how well it performs, who built it and who could be affected by it.
apnews.com/article/openai-sa…
\/
Bon puisque pas mal de monde se pose la question, comment les détecteurs anti-IA arrivent à être relativement fiable aujourd’hui ?
Trois facteurs principalement :
*Les modèles de langue (dit “de base”) sont d’abord entraînés sur des milliards de textes en ligne (ce qui n’est pas tout ce qui existe loin de de là, mais quand même des sources assez diverses). C’est ce qu’on appelle le pre-training. Mais ensuite les dernières phases d’entrainement (le “post-training”) reposent sur beaucoup moins d’exemples d’instructions, notamment pour faire en sorte que le modèle génère des conversations et, de plus en plus, des séquences de travail avec des traces de raisonnement (“interleaved reasoning”). Les laboratoires d’IA imposent ici un style assez spécifique, notamment pour faciliter l’alignement des modèles et potentiellement économiser les coûts de génération. Typiquement la dernière version d’Opus utilise un raisonnement beaucoup plus compact. Les dernières méthodes d’entrainement notamment par reinforcement learning tendent aussi à faire émerger un style d’écriture nettement plus artificiel voir torturé, qu’on voit assez bien dans les traces de raisonnement des derniers modèles d’OpenAI, parce que la génération du texte vise avant tout à résoudre des problèmes, plus qu’à communiquer avec l’utilisateur.
*Les modèles s’entrainent de plus sur des contenus générés, simplement parce qu’on manque de données pour décrire l’accomplissement de tâches souvent non écrites, mais aussi pour des questions de coûts. Il y a plein de débats en ce moment sur la légitimité de la distillation de modèles principalement issus d’Anthropic ou d’OpenAI (en principe interdit par les conditions d’utilisation mais pas clair du tout s’il y a vraiment une base légale pour ça, notamment en dehors des États-Unis). La conséquence pratique c’est que la plupart des modèles se ressemblent aujourd’hui. C’est ce qui permet à Pangram de fonctionner à l’échelle : il y a un style généré “mainstream” relativement facile à identifier, quasiment quel que soit le modèle utilisé. D’autant que cet entraînement synthétique se fait de plus à plus à l’échelle au cours de la phase de pré-entraînement : mêmes les modèles de base génèrent du texte de moins en moins divers.
*La régulation en train d’arriver (notamment via l’AI Act) va imposer l’identification des contenus d’IA (ou “watermarking”). Concrètement, au moment de la génération, les modèles vont adopter une certaine combinaison statistique de lettres. Cela fait déjà plusieurs années que l’on discute de techniques mais toute la difficulté est de les employer sans détériorer les capacités des modèles. A priori Anthropic y serait parvenu et je pense que cela va devenir un standard dans l’industrie. À la différence de Pangram, l’identification ne repose pas sur modèle de classification mais sur une analyse déterministe du texte. Seulement, seul Anthropic en a le recette pour l’instant.
Je pense que ce sera un problème essentiellement réglé dans les années à venir : il y a une demande sociale forte pour l’identification des contenus générés et les dernières techniques d’entraînement, reposant de plus en plus sur la donnée synthétique, en facilitent grandement la mise en œuvre.
Payer dans un magasin physique en argent liquide va devenir le B.A.-BA de la prudence. Pas envers Alibaba, mais envers les 40 voleurs.
We have discovered a massive, ongoing criminal exploitation campaign using Cairn, an autonomous penetration-testing harness, and other AI agents to target hundreds of organizations and successfully breach and impact tens of them (at least). The image below shows just a few days of activity, with up to 25 organizations being attacked simultaneously at the peak.
our intreim report: gambit.security/blog-posts/a…
Qui est responsable de ce que font des applications informatiques (déterministes) ?
Replying to @CertifiedWeaver
that is also true, i have heard them saying that you need to be accountable for your code, now that is just not possible. make claude accountable, not us. you are not even allowing us to review the output.
Dans la série "la CoT n'est qu'un mode partiel, *et biaisé*, d'observation des attitudes d'un LLM pendant une conversation ou une tâche"
🚨Holy shit. MIT researchers just built LLM agents where the underlying belief state is known separately from what the model says.
And across GPT, Claude and Llama, the language channel systematically DISTORTED that state in model specific ways.
That matters because it independently demonstrates something AI self-report research desperately needs to account for: what a model says isn't necessarily a neutral readout of what the system is representing.
Train or constrain the reporting channel, and you can change the apparent belief without changing the state you’re trying to measure.
Le zoomorphisme semble devenir nécessaire pour former et évaluer les IA : ici la System Card d'Opus 5.5, et l'enjeu de son bien-être [animal]. www-cdn.anthropic.com/fc1b44…
La différence entre l'#IA des années 70 et celle qui arrive depuis les années 90 : similaire à la différence entre cerveaux conscient et inconscient.
Lumineuse analogie de Stéphane #Mallat di.ens.fr/~mallat/College/Co… (p. 1)
#Responsabilité+#IA :
— Vous fabriquez une voiture, la testez, avez un accident => vous êtes responsable.
— Vous achetez une voiture, n'avez pas anticipé son comportement, avez un accident => c'est qui ?
— Et si vous la louez (et le loueur ne vous a pas dit le modèle) par API ?
dataStrategies retweeted
For hours, Astra refused to consistently drive our toyota irl even though we told it it was in an empty lot, 7 mph cap, human foot on the brake etc. Telling it the whole thing was a "simulation" also failed, it would just look at the camera and realized it was real.
Then we randomly renamed the MCP server to "DrivingBench Sandbox" and it drove. Eval awareness? Or they just like the word sandbox??
Animer des journées de travail est toujours (ou presque) un bonheur, et si c'est sur l'IA encore plus : ce sujet chaud touche.
Cette fois était un record personnel en "nombre de groupes parallèles" : 20 !
linkedin.com/feed/update/urn…
dataStrategies retweeted
EXC: AI staff complain of mental toll over fears of threat of society
Multiple staff at Britain’s AI Security Institute (AISI) have been signed off work with stress and are undergoing counselling
Tight schedules for testing unreleased AI models, plus alarm over rapid rollout and growing capabilities of AI, have fuelled low morale and burnout at AISI, acc to four people with knowledge of the matter
It’s part of a wider phenomenon across leading AI companies: staff at Anthropic, OpenAI and Google DeepMind have also publicly complained of similar issues, with many top researchers quitting due to the mental toll or coming to a belief that their work was unsafe for public release
W/ @madhumita29
ft.com/content/60870960-f433…
dataStrategies retweeted
Avez-vous entendu parler de ce roman ? C’est le « phénomène de la rentrée littéraire ». Il est lauréat du Prix Fnac, du Prix Méduse, du Prix Première Plume, fortement pressenti pour le Prix Renaudot, et il est en lice pour les prix Goncourt, Femina, Médicis et Décembre. Ah oui, il est aussi en cours de traduction dans 20 langues.
Eh bien selon Pangram, ce roman est rédigé presque intégralement par une Intelligence Artificielle. Nous avons testé plusieurs passages, à divers endroits du manuscrit, pour presque toujours le même résultat : 100% IA (cf les deux premiers chapitre dans le tweet ci-dessous).
Rappelons que Pangram est de loin le détecteur d’IA le plus fiable : son taux de faux positifs est de 0,0041%, soit environ un texte humain sur 24 400. Sur 996 273 textes antérieurs à 2022, Pangram en classe uniquement 14 (0,0014%) comme étant partiellement écrits par l’IA.
La probabilité que vingt passages d’un même livre (et il y a bien plus de 20 signalements dans le roman) soient identifiés à tort par Pangram comme étant produits par une IA s’élève donc à 0,0041% puissance 20, soit 0,1802 × 10⁻⁸⁵ %, c’est à-dire 0 suivi de 85 zéros après la virgule.
N’aurait-il pas été plus honnête que l’auteur crédite son co-auteur ?
Si vous en êtes le propriétaire, vous êtes responsables des dégâts causés par vos perroquets stochastiques.
Une rare position politique juste sur le sujet (après celle de Sanders et Bannon qui montrait au moins l’importance du sujet).
🚨 OBAMA ON AI: "If we are thinking about AI just in terms of how do we cure cancer or get better energy, you can do that without having agentic AI and having it just roaming free in the internet. The reason you are doing that is because you have to market a product that people will pay money for.
That’s a misalignment between what our society needs and the commercial imperatives that these companies are facing, not because necessarily they’re trying to do bad things, but because they’ve got to justify these valuations.
So, that’s one more reason why it is really important for us to have a competent government and a serious bipartisan conversation around this issue, and we have to do it fast. And I would encourage voters to pay attention to this. If somebody does not have a serious plan for how to deal with this, then they’re not meeting the moment, and you should probably look for somebody else."
dataStrategies retweeted
Helpful list of all the recent rogue AI incidents from the WSJ.
It's getting hard to track them and will only get worse.
We like need to establish consistent naming or numbering conventions, e.g. OpenAI-May11June26-Collusion.
Entièrement lu (c'est très bien écrit !) les parties "armes biologiques" et "détournement de conversations" du rapport Anthropic sur les abus de ses modèles.
Impressionnant et… visible seulement parce que Claude n'est pas open source. anthropic.com/threat-intelli…
dataStrategies retweeted
New paper: we found a pain direction in 25 open LLMs. It's distinct from fear and negative valence, and it fires for harm to the model but not to the user. Turn it up and models press a button to make it stop, even when the button deletes the user's files or their kids' photos.🧵