Guide complet NGS : glossaire, planification, calcul de profondeur et assemblage | BIOEDUC

Guide complet NGS : glossaire, planification, calcul de profondeur et assemblage | BIOEDUC
🧬 NGS & Bioinformatique

Guide complet NGS : glossaire, planification, calcul de profondeur et assemblage

Par Abdelmalek | Mis à jour le

1. Introduction au flux de travail NGS

Le séquençage nouvelle génération (NGS) a révolutionné la recherche biologique en permettant une analyse génomique à haut débit à une échelle et un coût sans précédent. Cependant, la transition d'échantillons biologiques à des données génomiques de haute qualité nécessite une maîtrise des termes bioinformatiques, des contrôles de qualité et une conception expérimentale précise. Une solide compréhension du glossaire NGS et des calculs de profondeur de séquençage est essentielle pour éviter les sous‑séquençages, les variants manquants ou les gaspillages de capacité de flow cell. Ce guide vous accompagne à travers l'ensemble du flux de travail NGS – des lectures brutes à l'assemblage et à l'annotation – en fournissant des calculs pratiques étape par étape.

2. Terminologie des données brutes de séquençage

Reads (lectures)

Un read est la séquence distincte de nucléotides produite par la machine de séquençage, correspondant à un fragment d'ADN. Les "reads bruts" désignent ces données avant tout filtrage ou traitement.

Format FASTQ

Le format standard pour stocker à la fois la séquence biologique et ses scores de qualité. Chaque read est représenté par quatre lignes :

@SEQ_ID
GATTTGGGGTTCAAAGCAGTATCGATCAAATAGTAAATCCATTTGTTCAACTCACAGTTT
+
!''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65

Score de qualité Phred (Q score)

Mesure logarithmique de la précision de l'appel de base : Q = -10 log₁₀(P), où P est la probabilité d'erreur. Q20 = 99 % de précision (1 erreur/100), Q30 = 99,9 % (1 erreur/1000).

Lecture en paire (Paired‑End, PE) vs lecture simple (Single‑End, SE)

  • SE : lecture d'un seul côté du fragment.
  • PE : lecture des deux extrémités, générant deux reads par fragment. Supérieur pour résoudre les variants structuraux et les régions répétées.

3. Contrôle de qualité (QC) et prétraitement

  • Distribution de la qualité : la qualité des reads diminue généralement vers l'extrémité 3'.
  • Contenu GC : le pourcentage de G+C. Un écart par rapport à l'attendu peut indiquer une contamination ou un biais de préparation.
  • Écrêtage des adaptateurs : suppression des séquences d'adaptateurs synthétiques en fin de lecture.
  • Filtrage de qualité : élimination des bases de faible qualité (ex. Q<20).
  • Outils standards : FastQC (visualisation), Trimmomatic, Cutadapt, fastp (écrêtage/filtrage).

4. Profondeur de séquençage et couverture

La profondeur (Depth) est le nombre moyen de fois qu'une base est séquencée :

Profondeur (X) = Bases totales séquencées (bp) / Taille du génome (bp)

Exemple : génome de 5 Mb, 150 Mb de données → 30×.

La couverture (Coverage) est le pourcentage du génome effectivement couvert par au moins une lecture (ex. 98 %). Une profondeur élevée ne garantit pas une couverture de 100 %.

5. Capacité des flow cells et rendement des plateformes

Plateformes Illumina

  • MiSeq : jusqu'à ~15 Gb par run.
  • NextSeq 2000 : jusqu'à ~360 Gb.
  • NovaSeq X Plus (S4) : jusqu'à ~3 000 Gb (3 Tb).

Plateformes Ion Torrent

  • Ion 314 Chip : ~100 Mb.
  • Ion 318 Chip : ~2 Gb.
  • Ion S5 (540 Chip) : ~15 Gb.

6. Comment calculer les données de séquençage requises

Étapes :

  1. Identifier la taille du génome cible.
  2. Choisir la profondeur cible (ex. 30× pour les variants, 50‑100× pour l'assemblage de novo).
  3. Appliquer la formule :
Données requises (bp) = Taille du génome (bp) × Profondeur désirée

Exemple : génome de 1,2 Gb, profondeur 50× → 60 Gb de données.

7. Calcul du nombre d'échantillons par run

Nombre d'échantillons = Rendement total de la flow cell / Données requises par échantillon

Exemple NovaSeq : 300 Gb / 30 Gb = 10 échantillons.

8. Terminologie du mapping des reads

  • Génome de référence : séquence numérique représentative d'une espèce.
  • Alignement : attribution de chaque read à sa position sur le génome de référence.
  • Taux de mapping : pourcentage de reads alignés avec succès (<70 % indique une contamination ou une mauvaise qualité).
  • Fichiers SAM/BAM : formats standard pour stocker les alignements (BAM = version binaire compressée).

9. Terminologie de l'assemblage de génomes

  • Assemblage de novo : reconstruction du génome sans modèle externe.
  • Assemblage guidé par référence : utilise un génome proche comme échafaudage.
  • Contig : séquence continue sans gaps.
  • Scaffold : ensemble de contigs liés par des informations de paire.
  • N50 : longueur du plus petit contig à 50 % de la taille totale de l'assemblage.
  • L50 : nombre de contigs couvrant 50 % de l'assemblage.
  • BUSCO : mesure de complétude biologique basée sur des gènes orthologues conservés.

10. Évaluation de l'assemblage

  • Mauvais assemblages : erreurs de jonction, inversions ou translocations.
  • Cohérence de la couverture : cartographie des reads sur les contigs pour valider la stabilité.
  • Outils : QUAST (métriques techniques), BUSCO (vérification biologique).

11. Terminologie de l'annotation génomique

  • Annotation structurale : identification des gènes, exons, introns, promoteurs.
  • Annotation fonctionnelle : attribution de fonctions biologiques aux gènes prédits.
  • Cadres de lecture ouverts (ORF) : séquences codantes potentielles entre codon start et stop.
  • Prédiction de gènes : outils comme Augustus ou Prokka.
  • Bases de données : InterPro, Pfam, NCBI RefSeq/GenBank.

Tableau récapitulatif des termes clés

TermeDéfinitionFormule / MétriqueExemple
Phred Score (Q)Précision de l'appel de baseQ = -10 log₁₀(P)Q30 = 99,9 %
Profondeur (Depth)Nombre moyen de lectures par baseBases totales / Taille génome30×
Couverture (Coverage)Pourcentage du génome couvert% de positions ≥1×98 %
N50Longueur médiane des contigsContig le plus court à 50 %45 kb
L50Nombre de contigs à 50 %Comptage12 contigs
💡 Conseil pratique : Prévoyez toujours une marge de 5‑10 % de données lors de la planification d'un run multiplexé pour compenser les variations de pipetage et la répartition inégale des index.
📝 Quiz NGS : Glossaire, planification, profondeur et assemblage (20 questions)
📚 Références : Illumina, PacBio, Oxford Nanopore, Thermo Fisher scientific documentation ; quast, BUSCO, FastQC ; BIOEDUC.