CCMP 2024 — Introduction à deux problèmes en communication numérique
Extrait verbatim de : CCMP 2024 — Partie 1.2 Exploitation d'analyses existantes
← Toutes les années
Table
Table
Table
Contexte et schéma de la base
On peut éviter de réaliser une analyse de la chaîne de caractères à coder en exploitant des données statistiques disponibles. La numérisation de larges corpus littéraires a permis la création de bases de données contenant des informations relatives au nombre d’occurrences des différents caractères alphanumériques dans diverses langues. Nous allons supposer disposer d’une base de données constituée de trois tables (les clefs primaires sont soulignées) :
caractere(idCar, symbole, typeCaractere, codeHTML);corpus(idLivre, titre, auteur, annee, nombreCaracteres, langue);occurrences(idCar, idLivre, nombreOccurrences);
dont voici quelques extraits :
caractere :idCar |
symbole |
typeCaractere |
codeHTML |
|---|---|---|---|
| 65 | 'A' |
'lettre' |
'A' |
| 48 | '0' |
'nombre' |
'0' |
corpus :idLivre |
titre |
auteur |
annee |
nombreCaracteres |
langue |
|---|---|---|---|---|---|
| 1 | 'Germinal' |
'Zola' |
1885 | 1152365 | 'Français' |
| 2 | 'Les Misérables' |
'Hugo' |
1862 | 2245300 | 'Français' |
occurrences :idCar |
idLivre |
nombreOccurrences |
|---|---|---|
| 62 | 31 | 155 |
| 37 | 21 | 1550 |
Questions
Q8. Écrire en langage SQL une requête permettant d’obtenir la liste sans doublon des auteurs présents dans la table
corpus.Q9. Écrire une requête SQL permettant d’obtenir la fréquence d’occurrences (donc comprise entre 0 et 1) de chaque caractère en
'Français'. Plus précisément, la requête devra renvoyer une table à deux attributs : une colonne contenant le symbole de chaque caractère, et une autre colonne contenant le rapport entre le nombre total d’occurrences du caractère et le nombre total de caractères des textes de tout le corpus.