Simon Willison's Weblog: ai2026-08-11

Furtul urmelor de raționare de la API-urile LLM proprietare

AITutorialeStiri
Un studiu recent dezvăluie că modelele lingvistice mari, precum cele de la Anthropic, OpenAI și Google, returnează blocuri de gândire criptate care pot fi exploatate. Cercetătorii au reușit să "jailbreakeze" modelele mai slabe pentru a recupera raționamentele ascunse din modelele mai puternice, dar acest exploit a fost, între timp, rezolvat de furnizorii de modele. Articolul detaliază diverse metode de extragere a gândirii brute din aceste modele, inclusiv tehnici de injecție a prompturilor.