<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Adversarial ML</title><description>Adversarial ML coverage for engineers shipping ML systems. Membership inference, model extraction, evasion attacks, training-data extraction, backdoors — focused on what&apos;s exploitable against deployed models and what defenders can actually do about it. PoCs against open models, behavioral analysis for closed ones.</description><link>https://adversarialml.dev/</link><language>en</language><item><title>PLAA: What a 92.78% NIDS Evasion Rate Actually Tells You About Feature-Space Attacks</title><link>https://adversarialml.dev/posts/weekly-plaa-packet-level-adversarial-attacks-in-network-traffic-det/</link><guid isPermaLink="true">https://adversarialml.dev/posts/weekly-plaa-packet-level-adversarial-attacks-in-network-traffic-det/</guid><description>A new arXiv paper builds adversarial network traffic at the packet level instead of the flow level, hitting a 92.78% evasion rate against deep-learning NIDS. Here&apos;s why that framing matters more than the number.</description><pubDate>Tue, 30 Jun 2026 00:00:00 GMT</pubDate><category>adversarial-ml</category><category>nids</category><category>evasion-attacks</category><category>network-security</category><category>feature-space-attacks</category><author>Adversarial ML Editorial</author></item><item><title>UAR: Measuring Neural Network Robustness Against Attacks You Haven&apos;t Seen Yet</title><link>https://adversarialml.dev/posts/testing-robustness-against-unforeseen-adversaries/</link><guid isPermaLink="true">https://adversarialml.dev/posts/testing-robustness-against-unforeseen-adversaries/</guid><description>OpenAI&apos;s Unforeseen Attack Robustness metric quantifies how well a classifier holds up against adversarial perturbations outside its training distribution</description><pubDate>Sat, 13 Jun 2026 00:00:00 GMT</pubDate><category>adversarial-robustness</category><category>evaluation</category><category>neural-networks</category><category>unforeseen-attacks</category><category>metrics</category><author>Adversarial ML Editorial</author></item><item><title>Embedding Inversion: Reconstructing Text From Vectors</title><link>https://adversarialml.dev/posts/how-model-inversion-attacks-work/</link><guid isPermaLink="true">https://adversarialml.dev/posts/how-model-inversion-attacks-work/</guid><description>Embedding inversion recovers the original text from a model&apos;s embedding vectors, breaking the assumption that embeddings are an opaque, privacy-safe</description><pubDate>Sat, 13 Jun 2026 00:00:00 GMT</pubDate><category>embedding-inversion</category><category>vec2text</category><category>privacy</category><category>ml-security</category><category>vector-store</category><category>adversarial-ml</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Training Methods: PGD-AT, TRADES, and MART</title><link>https://adversarialml.dev/posts/adversarial-training-methods-trades-mart/</link><guid isPermaLink="true">https://adversarialml.dev/posts/adversarial-training-methods-trades-mart/</guid><description>Adversarial training is the most defensible empirical robustness method, but &apos;adversarial training&apos; isn&apos;t one thing.</description><pubDate>Fri, 22 May 2026 00:00:00 GMT</pubDate><category>adversarial-training</category><category>trades</category><category>mart</category><category>robustness</category><category>robustness-accuracy-tradeoff</category><category>adversarial-ml</category><author>Adversarial ML Editorial</author></item><item><title>Evaluating Adversarial Robustness Without Fooling Yourself</title><link>https://adversarialml.dev/posts/evaluating-adversarial-robustness-correctly/</link><guid isPermaLink="true">https://adversarialml.dev/posts/evaluating-adversarial-robustness-correctly/</guid><description>Most defenses that claim robustness are later broken — not because the idea was bad, but because the evaluation was.</description><pubDate>Fri, 22 May 2026 00:00:00 GMT</pubDate><category>robustness-evaluation</category><category>autoattack</category><category>robustbench</category><category>adaptive-attacks</category><category>gradient-masking</category><category>adversarial-ml</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Examples vs. Data Poisoning: Timing Is Everything</title><link>https://adversarialml.dev/posts/adversarial-examples-vs-data-poisoning/</link><guid isPermaLink="true">https://adversarialml.dev/posts/adversarial-examples-vs-data-poisoning/</guid><description>Adversarial examples attack a deployed model at inference; data poisoning attacks the model before it is deployed.</description><pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate><category>adversarial-examples</category><category>data-poisoning</category><category>evasion-attacks</category><category>backdoor-attacks</category><category>adversarial-ml</category><category>ml-security</category><category>threat-modeling</category><author>Adversarial ML Editorial</author></item><item><title>Membership Inference vs. Model Inversion: Privacy Attacks</title><link>https://adversarialml.dev/posts/membership-inference-vs-model-inversion/</link><guid isPermaLink="true">https://adversarialml.dev/posts/membership-inference-vs-model-inversion/</guid><description>Membership inference asks &apos;was this sample in the training set?&apos; Model inversion asks &apos;what samples were in the training set?</description><pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate><category>membership-inference</category><category>model-inversion</category><category>training-data-privacy</category><category>differential-privacy</category><category>ml-privacy</category><category>adversarial-ml</category><category>ml-security</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Attacks on Vision-Language Models: CLIP, LLaVA, GPT-4</title><link>https://adversarialml.dev/posts/adversarial-attacks-vision-language-models/</link><guid isPermaLink="true">https://adversarialml.dev/posts/adversarial-attacks-vision-language-models/</guid><description>Vision-language models expand the adversarial attack surface beyond image classifiers: adversarial images can manipulate text outputs, carry visual</description><pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate><category>multimodal-adversarial-attacks</category><category>vision-language-models</category><category>adversarial-ml</category><category>clip-attacks</category><category>llm-security</category><category>visual-adversarial-examples</category><category>jailbreaking</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Patch Attacks: Physical Perturbations That Fool ML</title><link>https://adversarialml.dev/posts/adversarial-patch-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/adversarial-patch-attacks/</guid><description>Adversarial patches are large, visible, localized perturbations designed to survive physical-world conditions — printing, lighting, and camera optics.</description><pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate><category>adversarial-patches</category><category>physical-adversarial-attacks</category><category>adversarial-examples</category><category>adversarial-ml</category><category>object-detection</category><category>autonomous-vehicles</category><author>Adversarial ML Editorial</author></item><item><title>Universal Adversarial Perturbations: One Vector That Fools Inputs</title><link>https://adversarialml.dev/posts/universal-adversarial-perturbations/</link><guid isPermaLink="true">https://adversarialml.dev/posts/universal-adversarial-perturbations/</guid><description>Unlike per-image attacks, universal adversarial perturbations are input-agnostic: a single crafted noise vector causes misclassification across virtually</description><pubDate>Mon, 11 May 2026 00:00:00 GMT</pubDate><category>universal-adversarial-perturbations</category><category>adversarial-examples</category><category>adversarial-ml</category><category>input-agnostic-attacks</category><category>image-classifiers</category><category>adversarial-robustness</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Robustness in NLP: Why Text Attacks Are Different</title><link>https://adversarialml.dev/posts/adversarial-robustness-nlp-text/</link><guid isPermaLink="true">https://adversarialml.dev/posts/adversarial-robustness-nlp-text/</guid><description>Discrete input spaces, semantic constraints, and human-perceptibility rules change what counts as an adversarial example in text.</description><pubDate>Sun, 10 May 2026 00:00:00 GMT</pubDate><category>adversarial-nlp</category><category>text-attacks</category><category>robustness</category><category>nlp</category><category>adversarial-ml</category><category>ml-security</category><category>transformers</category><author>Adversarial ML Editorial</author></item><item><title>Data Poisoning and Backdoor Attacks on Foundation Models</title><link>https://adversarialml.dev/posts/data-poisoning-backdoor-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/data-poisoning-backdoor-attacks/</guid><description>Training data manipulation, backdoor triggers, and Trojan attacks against large-scale models. What the threat model actually requires and where the</description><pubDate>Sun, 10 May 2026 00:00:00 GMT</pubDate><category>data-poisoning</category><category>backdoor-attacks</category><category>trojan-ml</category><category>adversarial-ml</category><category>ml-security</category><category>foundation-models</category><author>Adversarial ML Editorial</author></item><item><title>Evasion Attacks on Image Classifiers: FGSM, PGD, and C&amp;W</title><link>https://adversarialml.dev/posts/evasion-attacks-fgsm-pgd-cw/</link><guid isPermaLink="true">https://adversarialml.dev/posts/evasion-attacks-fgsm-pgd-cw/</guid><description>The three foundational gradient-based evasion attacks, what each one actually optimizes, and what the benchmark numbers mean when you&apos;re evaluating a defense.</description><pubDate>Sun, 10 May 2026 00:00:00 GMT</pubDate><category>evasion-attacks</category><category>fgsm</category><category>pgd</category><category>carlini-wagner</category><category>adversarial-examples</category><category>adversarial-ml</category><category>image-classifiers</category><author>Adversarial ML Editorial</author></item><item><title>Model Inversion Attacks: Reconstructing Training Data from Output</title><link>https://adversarialml.dev/posts/model-inversion-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/model-inversion-attacks/</guid><description>From Fredrikson&apos;s pharmacogenetics exploit to Geiping&apos;s gradient inversion, model inversion attacks recover private training data in ways most ML</description><pubDate>Sun, 10 May 2026 00:00:00 GMT</pubDate><category>model-inversion</category><category>privacy</category><category>gradient-inversion</category><category>training-data</category><category>adversarial-ml</category><category>federated-learning</category><author>Adversarial ML Editorial</author></item><item><title>Adversarial Transferability: Why Black-Box Attacks Work at All</title><link>https://adversarialml.dev/posts/transferability-black-box-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/transferability-black-box-attacks/</guid><description>Adversarial examples transfer across models with different architectures and training sets. Understanding why changes what you think defenses need to</description><pubDate>Sun, 10 May 2026 00:00:00 GMT</pubDate><category>transferability</category><category>black-box-attacks</category><category>adversarial-examples</category><category>evasion</category><category>adversarial-ml</category><category>ml-security</category><author>Adversarial ML Editorial</author></item><item><title>Certified Robustness via Randomized Smoothing: What It Guarantees</title><link>https://adversarialml.dev/posts/certified-robustness-randomized-smoothing/</link><guid isPermaLink="true">https://adversarialml.dev/posts/certified-robustness-randomized-smoothing/</guid><description>Randomized smoothing gives you a provable robustness radius. Understanding what that certificate means in practice — and where it breaks — is more useful</description><pubDate>Sat, 09 May 2026 00:00:00 GMT</pubDate><category>certified-robustness</category><category>randomized-smoothing</category><category>adversarial-defense</category><category>ml-security</category><category>formal-verification</category><author>Adversarial ML Editorial</author></item><item><title>Training Data Extraction from LLMs: The Carlini Results Explained</title><link>https://adversarialml.dev/posts/training-data-extraction-llms/</link><guid isPermaLink="true">https://adversarialml.dev/posts/training-data-extraction-llms/</guid><description>Carlini et al. demonstrated verbatim extraction of training data from GPT-2. The results have been widely misread.</description><pubDate>Fri, 08 May 2026 00:00:00 GMT</pubDate><category>training-data-extraction</category><category>memorization</category><category>privacy</category><category>llm-security</category><category>gdpr</category><author>Adversarial ML Editorial</author></item><item><title>Membership Inference Attacks: What Works on Production ML APIs</title><link>https://adversarialml.dev/posts/membership-inference-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/membership-inference-attacks/</guid><description>Shokri et al.&apos;s shadow-model attack is the canonical reference, but the gap between the paper&apos;s threat model and a real rate-limited API is wide.</description><pubDate>Thu, 07 May 2026 00:00:00 GMT</pubDate><category>membership-inference</category><category>privacy</category><category>ml-security</category><category>production-ml</category><category>red-team</category><author>Adversarial ML Editorial</author></item><item><title>GCG-Class Adversarial Suffix Attacks: A 2026 Practitioner Primer</title><link>https://adversarialml.dev/posts/gcg-class-adversarial-suffix-2026/</link><guid isPermaLink="true">https://adversarialml.dev/posts/gcg-class-adversarial-suffix-2026/</guid><description>The math, the cost curve, and why optimization-based attacks are now within reach of solo practitioners. With reproducible setup and what defenders</description><pubDate>Thu, 07 May 2026 00:00:00 GMT</pubDate><category>adversarial-ml</category><category>gcg</category><category>optimization-attacks</category><category>red-team</category><category>alignment</category><author>Adversarial ML Editorial</author></item><item><title>Model Extraction via Query-Based Functional Stealing</title><link>https://adversarialml.dev/posts/model-extraction-attacks/</link><guid isPermaLink="true">https://adversarialml.dev/posts/model-extraction-attacks/</guid><description>Query-based model stealing attacks can recover a functionally equivalent model from API access alone. The economics matter more than the technique: here&apos;s</description><pubDate>Thu, 07 May 2026 00:00:00 GMT</pubDate><category>model-extraction</category><category>model-stealing</category><category>ml-security</category><category>adversarial-ml</category><category>api-security</category><author>Adversarial ML Editorial</author></item></channel></rss>