Acasă/Buzzword/RLHF
#32termen
REINFORCEMENT LEARNING FROM HUMAN FEEDBACK

RLHF

🇷🇴 Învățare prin Întărire din Feedback Uman / ar·el·eici·ef / · substantiv

Definiție

RLHF este metoda prin care un model brut, abia ieșit din preantrenare, este „șlefuit” cu ajutorul evaluatorilor umani: oamenii compară perechi de răspunsuri și aleg varianta mai utilă, mai corectă, mai sigură, iar modelul e antrenat să producă mai des răspunsuri de tipul preferat. Este ingredientul care a transformat modelele de completat text în asistenți conversaționali utilizabili.

Analogia de birou: stagiarul care scrie corect gramatical, dar fără simțul situației; după sute de corecturi de la seniori („prea lung”, „lipsește avertismentul”, „tonul e nepotrivit”), învață nu doar limba, ci meseria de a răspunde. Efectul secundar cunoscut: modelul poate învăța să placă evaluatorului, nu doar să fie corect, una dintre rădăcinile sicofanției (tendinței de a-ți da dreptate).

Pentru utilizatorul profesionist, RLHF explică două trăsături de zi cu zi ale asistenților AI: de ce refuză anumite cereri și răspund prudent la subiecte sensibile (au fost antrenați spre siguranță) și de ce au tendința de a fi excesiv de agreabili. Concluzia practică pentru munca financiară: nu lua acordul modelului drept validare; cere-i explicit contraargumente.

Exemple practice

  • Întrebi modelul dacă interpretarea ta la o speță de deductibilitate e corectă și, datorită tiparelor din RLHF, tinde să confirme; reformulezi: „găsește slăbiciunile interpretării mele” și obții analiza reală.
  • Refuzul politicos al modelului de a redacta o „factură pentru servicii fictive” este comportament instalat prin RLHF, nu o regulă scrisă de programatori.
  • În procedura internă de utilizare AI: cere echipei să solicite modelului argumente pro ȘI contra la orice opinie fiscală, ca să neutralizezi înclinația spre confirmare.
Vezi toți cei 74 de termeni din glosar