Simon Willison's Weblog: ai2026-08-11

Furtul urmelor de raționare din API-urile LLM proprietare

AITutorialeStiri
Un studiu recent a arătat că modelele de inteligență artificială de la Anthropic, OpenAI și Google returnează blocuri de raționare criptate utilizatorilor, care pot fi reintroduse în modele mai slabe pentru a le "jailbreak-ui". Această vulnerabilitate a fost corectată de modelul 4.6 de la Claude, după ce autorii au raportat descoperirile lor, dar modelul Haiku 4.5 a fost mai puțin rezistent la atacuri. De asemenea, s-a identificat o variantă de injecție a prompturilor care permite extragerea datelor prin manipularea gândirii modelului.