Credibilità e misurazione

Risultati con periodo, baseline e limiti.

Non tutti i workflow richiedono la stessa metrica. Il sito distingue performance predittiva, affidabilità operativa e controlli di sicurezza.

Principio generale

Limiti di regole, indicatori e modelli

Gli output prodotti da regole, indicatori e modelli sono risultati sperimentali o informativi, non decisioni.

Possono essere incompleti, instabili o errati, soprattutto in presenza di dati mancanti o ritardati, eventi eccezionali, cambiamenti di regime o condizioni differenti da quelle osservate durante la progettazione e la validazione.

Ogni risultato deve essere interpretato, quando pertinenti e disponibili, insieme a baseline, periodo osservato, numerosità del campione, metriche, misura dell’incertezza e condizioni note di fallimento.

Risultati e stato delle evidenze

Che cosa è misurato, in valutazione o operativo.

La tabella non inventa un punteggio comune: distingue evidenza predittiva, affidabilità operativa e attività ancora in maturazione.

WorkflowStato evidenzaMaturitàDettaglio
WF-1 · Weather automationOperativoAttivo · educativoApri la pagina per metriche, periodo e limiti disponibili.
WF-2 · The New MarginIn valutazioneAttivo · sperimentaleApri la pagina per metriche, periodo e limiti disponibili.
WF-3 · Market OverviewIn valutazioneAttivo · sperimentaleApri la pagina per metriche, periodo e limiti disponibili.
WF-4 · AI Supply ChainIn valutazioneAttivo · sperimentaleApri la pagina per metriche, periodo e limiti disponibili.
WF-5 · SatelliteOperativoAttivo · condizionato all’eventoApri la pagina per metriche, periodo e limiti disponibili.
WF-6 · Termometro della crisi energeticaIn valutazioneAttivo · sperimentaleApri la pagina per metriche, periodo e limiti disponibili.
WF-7 · Etna ForecastMisurato nel workflowAttivo · educativoApri la pagina per metriche, periodo e limiti disponibili.
WF-8 · Bluesky multi-fonteOperativoAttivo · sperimentaleApri la pagina per metriche, periodo e limiti disponibili.
WF-9 · World Economy EngineIn valutazioneAttivo · sperimentale · evidence-awareApri la pagina per metriche, periodo e limiti disponibili.
WF-10 · Etna SentinelOperativoAttivo · educativo · fail-closedApri la pagina per metriche, periodo e limiti disponibili.
WF-11 · Hydrogen Route ObservatoryCalcolo verificabileSperimentale · calculation · evidence-awareApri la pagina per metriche, periodo e limiti disponibili.
WF-12 · Ammonia & Fertilizer ChainForecast in maturazioneSperimentale · calculation + forecastApri la pagina per metriche, periodo e limiti disponibili.
WF-13 · Italy Variable Renewable ForecastFonte osservata condizionataSperimentale · forecast · point-in-timeApri la pagina per metriche, periodo e limiti disponibili.
WF-14 · Process SentinelBenchmark sinteticoSperimentale · impianto simulatoApri la pagina per metriche, periodo e limiti disponibili.
WF-15 · Virtual AnalyzerBenchmark sinteticoSperimentale · laboratorio simulatoApri la pagina per metriche, periodo e limiti disponibili.
WF-16 · Energy & Steam OptimizerOttimizzazione simulataSperimentale · hybrid optimizationApri la pagina per metriche, periodo e limiti disponibili.

Misurato nel workflow indica che la pagina pubblica metriche specifiche; in valutazione indica metriche pertinenti ma non ancora centralizzate; operativo riguarda controlli, run e tracciabilità, non skill predittiva.

Metriche generali disponibili

Forecast

Errore, bias, copertura, accuratezza direzionale e confronto con baseline, solo su esiti maturati.

Classificazioni e anomalie

Precision, recall o frequenza delle anomalie quando esiste un’etichetta affidabile; altrimenti contesto e revisione umana.

Workflow operativi

Run riusciti, falliti, saltati, bloccati, dati mancanti e duplicati evitati.

Regola di trasparenza

Mai mostrare solo la metrica migliore; indicare periodo, campione e natura preliminare.

Stato dei workflow

Stato dei workflow
WorkflowStatoCadenzaMetriche pertinenti
WF-1 · Meteo e disagio cervicaleAttivo · educativoLunedì, mercoledì e venerdìContinuità dei run, dati mancanti intercettati e duplicati evitati. Non sono dichiarate metriche cliniche.
WF-2 · Margini di raffinazione e forecastAttivo · sperimentaleSettimanaleMAE, errore mediano, bias e copertura degli intervalli, con periodo e numero di forecast maturati.
WF-3 · Market OverviewAttivo · sperimentaleGiorni ferialiAccuratezza direzionale, ampiezza media, errori, stabilità per periodo e confronto con baseline.
WF-4 · AI Supply ChainAttivo · sperimentaleSettimanaleConfronto modello-naïve, errore dell’outlook e stabilità dei panieri nel tempo.
WF-5 · Satellite — Etna event-basedAttivo · event-drivenControllo ogni 6 ore; pubblicazione solo su nuovo evento validoEsiti dei run (pubblicato, saltato, bloccato), disponibilità delle fonti e duplicati evitati. Non viene dichiarata skill di dispersione operativa.
WF-6 · Termometro della crisi energeticaAttivo · sperimentalePiù run settimanaliCopertura dei driver, confidenza shipping, metriche OOS del forecast, Dynamic vs Static, drawdown e stabilità per periodo.
WF-7 · Etna ForecastAttivo · educativoLunedì, giovedì, domenica ed eventiBrier score, confronto con climatologia/persistenza/Hawkes, calibrazione, campione maturato e sorgente selezionata dal gate.
WF-8 · Bluesky multi-fonteAttivo · sperimentaleLunedì, mercoledì e venerdìAudit del gate fonti, ricevute di pubblicazione, conteggio grapheme, output multi-immagine e verifica PDS/AppView.

Lo stato indica la maturità progettuale, non garantisce disponibilità continua delle fonti esterne.

Come usare queste evidenze

Metriche diverse rispondono a domande diverse.

Technical reviewer

Capacità di delivery

Osservare test, modularità, logging, schedule, gestione degli errori e comunicazione dei limiti.

Mappa professionale →
Industria

Affidabilità operativa

Valutare freshness, run saltati, gate bloccanti, idempotenza e tracciabilità degli output.

Applicazioni →
Dati non ancora centralizzati: il sito non inventa una percentuale complessiva di run riusciti. Sarà mostrata solo quando un registro automatico comune alimenterà il dato.