MP*1 et MP*2 — Sainte-Geneviève

CCMP 2024 — Introduction à deux problèmes en communication numérique

Extrait verbatim de : CCMP 2024 — Partie 1.2 Exploitation d'analyses existantes

← Toutes les années

Contexte et schéma de la base

On peut éviter de réaliser une analyse de la chaîne de caractères à coder en exploitant des données statistiques disponibles. La numérisation de larges corpus littéraires a permis la création de bases de données contenant des informations relatives au nombre d’occurrences des différents caractères alphanumériques dans diverses langues. Nous allons supposer disposer d’une base de données constituée de trois tables (les clefs primaires sont soulignées) :

  • caractere(idCar, symbole, typeCaractere, codeHTML) ;
  • corpus(idLivre, titre, auteur, annee, nombreCaracteres, langue) ;
  • occurrences(idCar, idLivre, nombreOccurrences) ;

dont voici quelques extraits :

Table caractere :
idCar symbole typeCaractere codeHTML
65 'A' 'lettre' 'A'
48 '0' 'nombre' '0'
Table corpus :
idLivre titre auteur annee nombreCaracteres langue
1 'Germinal' 'Zola' 1885 1152365 'Français'
2 'Les Misérables' 'Hugo' 1862 2245300 'Français'
Table occurrences :
idCar idLivre nombreOccurrences
62 31 155
37 21 1550

Questions

Q8. Écrire en langage SQL une requête permettant d’obtenir la liste sans doublon des auteurs présents dans la table corpus.
Q9. Écrire une requête SQL permettant d’obtenir la fréquence d’occurrences (donc comprise entre 0 et 1) de chaque caractère en 'Français'. Plus précisément, la requête devra renvoyer une table à deux attributs : une colonne contenant le symbole de chaque caractère, et une autre colonne contenant le rapport entre le nombre total d’occurrences du caractère et le nombre total de caractères des textes de tout le corpus.