Ricerca

Organizzare un database di ricerca

Dal file grezzo al database versionato: dataset di base per patologia, un indice pseudonimizzato, controlli di qualità e una pagina di interrogazione che mostra solo dati aggregati.

Assistente (CCA, AHU)Professore associato (MCU-PH)Professore ordinario (PU-PH)CoworkClaude CodeArtefattoProgetto di lungo periodo

Interrogazione della banca dati di ricerca: numerosità aggregate per combinazione, senza identificativi.Animazione di uno strumento reale · dati fittizi
Pagina di interrogazione della banca dati: popolazione, dati disponibili, numerosità aggregate, senza identificativi.
Pagina di interrogazione della banca dati: popolazione, dati disponibili, numerosità aggregate, senza identificativi.

Schermata di uno strumento reale · dati fittizi, nomi sfocati · interfaccia in inglese

Il problema

Anni di fogli di calcolo di coorti, esportazioni di esami e raccolte dati di tesi, ciascuno nel proprio formato. La domanda «quanti pazienti abbiamo con questo fenotipo e questo dato?» richiede una settimana.

Metodo passo per passo

  1. Una pipeline scritta: originale → grezzo → armonizzato → database → analisi → esportazione, ogni fase nella propria cartella; nulla viene modificato sul posto.

  2. Dataset di base per patologia, ciascuno con la sua versione (candidata, congelata) e una procedura di congelamento.

  3. Un indice pivot pseudonimizzato per eliminare i doppioni dei pazienti presenti in più coorti, conservato sulla postazione locale.

  4. Regole di controllo qualità e un registro delle decisioni (perché una certa variabile è stata ricodificata).

  5. Distinguere «misura presente nel database» da «file disponibile»: si sa che cosa è davvero utilizzabile.

  6. Una pagina di interrogazione che gestisce solo dati aggregati: popolazione, criteri, dati richiesti, risultato sotto forma di conteggi.

  7. L’estrazione di dati identificativi avviene in locale, tramite uno script, sulla base di una «richiesta di estrazione» convalidata.

  8. Un «cassetto chiuso a chiave» per i dati sensibili: ciò che non deve mai entrare negli strumenti di IA viene isolato e documentato, e le questioni aperte sull’accesso vengono risolte con l’istituzione.

  9. Esportazioni per i collaboratori: cifre e tabelle aggregate, mai dati individuali.

Risultato

Un database versionato e documentato, e una risposta in pochi minuti alla domanda «quanti pazienti per questo studio?».

Salvaguardie

Dati sanitari: il quadro normativo applicabile alla ricerca (dichiarazione, metodologia di riferimento, informazione dei pazienti), archiviazione autorizzata dall’istituzione, nessun dato identificativo in un servizio non autorizzato. Consultare l’ufficio per la ricerca clinica e il DPO (responsabile della protezione dei dati) della propria istituzione.

Prompt di partenza

Ecco l’elenco (solo i nomi delle colonne, nessun dato) dei miei 4 file di coorte. Proponi un dizionario dei dati armonizzato, regole di controllo qualità e la struttura delle cartelle della pipeline. Non aprire alcun dato dei pazienti.

← Torna al trittico