Skip to content
Berktug Berke Ates
Berktug Berke Ates

Software Engineer

Blog

Valutare gli output degli LLM senza affidarsi all’intuizione

· 8 min di lettura

Sostituisci i rilasci basati sulle vibrazioni con suite di valutazione che riflettono il rischio reale del prodotto.

Definisci le proprietà che contano

Punteggi di accuratezza generici raramente proteggono un prodotto. Decidi quali proprietà utenti e business non possono compromettere: grounding fattuale, validità dello schema, tono, qualità del rifiuto, latenza, presenza di citazioni o conformità alle policy. Funzionalità diverse richiedono scorecard diverse.

Scrivi queste proprietà come check misurabili. Una risposta fondata deve citare fonti ammesse. Un assistente di prenotazione non deve inventare inventario. Un helper di supporto deve rifiutare richieste di takeover dell’account. La valutazione parte dalle promesse di prodotto, non dalle leaderboard dei modelli.

Costruisci un dataset vivo

Raccogli esempi da problemi di produzione, ticket di supporto, prompt avversari e edge case scoperti in ricerca. Tieni le informazioni personali fuori dalla suite o sostituiscile con sostituti sintetici realistici. Versiona il dataset insieme a prompt e impostazioni del modello.

Includi casi che devono fallire con grazia. Una valutazione che copre solo i percorsi felici approverà regressioni nei momenti che danneggiano di più la fiducia.

  • Separa le suite offline dal campionamento online
  • Calibra i grader automatici con review umana periodica
  • Blocca i rilasci sulle regressioni delle proprietà critiche
  • Traccia la copertura della valutazione per user journey

Automatizza il banale, revisiona il sottile

Check di schema, rilevamento di frasi proibite, presenza di citazioni e fixture deterministiche possono girare a ogni cambio. Qualità sfumate come utilità o empatia richiedono ancora giudizio umano campionato. Usa l’automazione per ampliare la copertura e gli umani per mantenere onesti i grader.

Quando cambiano modello o prompt, confronta con la baseline precedente piuttosto che con una fantasia assoluta di perfezione. La domanda è se il prodotto è diventato più sicuro e utile per gli utenti che servi.

Chiudi il loop dopo il lancio

La produzione inventerà casi che la suite non ha mai immaginato. Reinserisci rapidamente i fallimenti ad alta severità nella valutazione. Abbinali alla telemetria: tassi di thumbs-down, distanza di edit sulle correzioni degli utenti, escalation agli umani e completamento dei task.

La valutazione non è una cerimonia prima del lancio. È il sistema immunitario continuo di un prodotto di IA.


Pubblicato il 28 gennaio 2026 da Berktug Berke Ates.