Nivell de calitat Phred
El nivell de calitat Phred (Phred quality score, en Inglés) és una mida de calitat en l'identificació de les nucleobases generades per la seqüenciació automatizado d'ADN.Va ser popularisat pel software de cridada base PHRED de Phil Green.[1]
Esta mida de calitat està àmpliament acceptada per a caracterisar la calitat de les nostres seqüències de ADN basades en la capacitat de poder ser comparades entre diferents métodos de seqüenciació. Originalment va ser desenrollat per a les cridades de base de Phred ( Phred base calling, en Inglés) que és un programa informàtic dissenyat per a l'identificació d'una seqüència de base o nucleobase a partir de senyals de fluorescència generats per un seqüenciador de ADN automatizado.
L'us més important dels nivells de calitat de Phred és la determinació automàtica de seqüències consens precises basades en la calitat de la seua seqüenciació.
Definició
[editar | editar còdic]El nivell de calitat Phred o Q, es definix com una propietat que està relacionada logarítmicamente en les provabilitats d'error de les cridades de base (P).
o .
Eixemple:
Si Phred assigna un nivell de calitat de 30 a una base en concret, les provabilitats de que esta base siga incorrecta és d'1 entre 1000 ya que:
, per lo que P és igual a 0.001 i açò es traduïx que en un nivell de calitat 30 el factor d'error seria d'1 base entre 1000 en el mateix nivell de calitat Phred.
| Nivell de calitat Phred | Provabilitat de factor d'error de base | Precisió de que la base siga correctament nomenada |
|---|---|---|
| 10 | 1 en 10 | 90% |
| 20 | 1 en 100 | 99% |
| 30 | 1 en 1000 | 99,9% |
| 40 | 1 en 10.000 | 99,99% |
| 50 | 1 en 100.000 | 99,999% |
| 60 | 1 en 1.000.000 | 99,9999% |
Interpretació en una seqüència FASTQ
[editar | editar còdic]Un archiu FASTQ normalment usa quatre llínees per seqüència.
- La llínea 1: comença en un caràcter i va seguida d'un identificador de seqüència i una descripció opcional (com una llínea de títul FASTA).
- La llínea 2: són nucleobases que varen ser decodificados per algun método de seqüenciació.
- La llínea 3: comença en un caràcter '+' i, opcionalmente , li seguix el mateix identificador de seqüència (i qualsevol descripció) novament.
- La llínea 4: codifica els valors de calitat per a la seqüència de la llínea 2 i deu contindre la mateixa cantitat de símbols que lletres en la seqüència.
Un archiu FASTQ que continga una sola seqüència podria vore's aixina:
SEQ_ID GATTTGGGGTTCAAAGCAGTATCGATCAAATAGTAAATCCATTTGTTCAACTCACAGTTT + !''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65
En un archiu FASTQ es poden observar estes calitats. La calitat s'interpreta com la provabilitat d'una cridada de base incorrecta (p. eix., 1 en 10) o, de manera equivalent, la precisió de la cridada de base (p. eix., 90 %). Per a que siga possible alinear cada nucleòtit individual en la seua puntuació de calitat, la puntuació numèrica es convertix en un còdic en el que cada caràcter individual representa la puntuació de calitat numèrica d'un nucleòtit individual.[2]
!''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65
El valor numèric assignat a cada u d'estos caràcters depén de la plataforma de seqüenciació que va generar les llectures. Per a este eixemple la codificació de puntuació PHRED de calitat estàndar que es va utilisar va ser de Sanger, utilisant Illumina versió 1.8 en avant. A cada caràcter se li assigna una puntuació de calitat entre 0 i 41, com es mostra en el gràfic a continuació:
Codificació de calitat: !"#$%&'()*+,-./0123456789:;<=>?ABCDEFGHIJ
| | | | |
Puntuació de calitat: 01........11........21........31........41
Cada puntuació de calitat representa la provabilitat de que la cridada de nucleòtit corresponent siga incorrecta. Este puntaje de calitat es basa logarítmicamente, per lo que un puntaje de calitat de 10 reflectix una precisió de cridada base del 90 %, pero un puntaje de calitat de 20 reflectix una precisió de cridada base del 99 %. Estos valors de provabilitat són els resultats de l'algoritme de cridada base i depenen de la cantitat de senyal capturada per a l'incorporació de la base.[2]
Referències
[editar | editar còdic]- ↑ «Phred scale - Genome Analysis Wiki». genome.sph.umich.edu. Consultat el 2022-09-16.
- ↑ 2,0 2,1 «Assessing Read Quality – Data Wrangling and Processing for Genomics». datacarpentry.org. Consultat el 2022-09-16.
Referències
[editar | editar còdic]
- Este artícul conté una traducció derivada de «Nivel de calidad Phred» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.