Acasă/Buzzword/INFERENCE
#22termen
INFERENȚĂ — FAZA DE UTILIZARE A MODELULUI

INFERENCE

🇷🇴 Inferență / in·fe·rens / · substantiv

Definiție

Inferența este momentul în care un model deja antrenat produce un răspuns: primește promptul tău și generează rezultatul, token cu token. Este „faza de utilizare”, distinctă de faza de antrenare. Analogie contabilă: antrenarea e ca formarea profesională a unui angajat (lungă, costisitoare, o singură dată); inferența e ziua lui obișnuită de muncă, în care fiecare sarcină rezolvată consumă timp și resurse curente.

Distincția contează pentru că economia celor două faze e complet diferită: antrenarea costă enorm o dată; inferența costă puțin, dar de fiecare dată, iar la volume mari devine costul dominant. Viteza de inferență (latența) determină experiența practică: un model care răspunde în 2 secunde e utilizabil interactiv; unul care „gândește” 2 minute e potrivit doar pentru procesări în fundal.

Pentru bugetarea unui proiect AI în contabilitate, inferența este linia de cost recurentă: fiecare factură procesată, fiecare raport generat, fiecare întrebare pusă consumă inferență, plătită de regulă per token. Optimizarea inferenței (modele mai mici pentru sarcini simple, prompturi mai scurte, procesare în loturi) este pârghia principală de control al costurilor la scară.

Exemple practice

  • Procesarea zilnică a 300 de facturi prin API: fiecare document = o cerere de inferență; costul lunar se estimează din tokeni per document × volum.
  • Un raport complex generat de un model de raționament durează 1–2 minute de inferență, deci planifici generarea în fundal, nu în timpul întâlnirii cu clientul.
  • Mutarea clasificării de tranzacții de pe modelul flagship pe un model mic reduce costul de inferență de câteva ori, fără pierdere vizibilă de calitate pe această sarcină.
Vezi toți cei 74 de termeni din glosar