Résumé
De nombreuses données intéressantes ne résident pas dans des SGBD, mais dans des fichiers « presque » tabulaires. Dans « presque » se cachent beaucoup de difficultés : les données ont souvent des défauts de régularité qui empêchent leur ingestion automatique. Dans des fichiers de type tableur, les cellules de données peuvent alterner de façon plus ou moins désordonnée avec des cellules de légende, certaines lignes sont des agrégats calculés sur d’autres, un feuillet peut comporter plusieurs tableaux… De tels fichiers contiennent souvent des statistiques, telles que la production de différents biens ou la natalité par région. Ils sont donc précieux pour vérifier la précision d’affirmations faites sur ces sujets (« fact-checking »). Nous présenterons des méthodes récentes pour les trouver, les comprendre, et construire des méthodes adaptées à la vérification.