Anar al contingut

Conversor text-veu

De L'Enciclopèdia, la wikipedia en valencià

La conversió text-veu és la generació per mijos automàtics d'una veu artificial que genera el produït per una persona en llegir un text qualsevol en veu alta. o una veu artificial. És dir, són sistemes que permeten la conversió de texts en veu sintètica. Els conversores de text-veu són coneguts també en les sigles CTV o per les sigles en anglés TTS (Text To Speech).

Requisits dels conversores CTV/TTS

[editar | editar còdic]
  1. Deu produir una veu sintètica (artificial) que resulte natural i siga inteligible.
  2. La síntesis del parla ha de ser completament automàtica, sense que es tinga que introduir cap tipo de reajustament manual en ninguna parte del procés.
  3. El text introduït en el sistema ha de ser un text arbitrari qualsevol, no pot estar amañado en cap sentit.

Fases de la conversió text-veu

[editar | editar còdic]
  • En la primera fase es realisa una representació llingüística simbòlica, per a això se seguixen tres processos consecutius:
  1. Normalisació del text. Es convertix la totalitat del text a una forma textual convencional. Açò afecta principalment a les sifres, abreviatures, etc. A la normalisació del text també li la denomina pre-processat o tokenización.
  2. Conversió fonètica. Una volta normalisat el text s'assignen transcripcions fonètiques a cada paraula. El procés de convertir les transcripcions fonètiques en paraules es denomina «conversió text-fonema» (TTP en les seues sigles en anglés de text-to-phoneme) o «conversió grafema-fonema» (GTP en les seues sigles en anglés de grapheme-to-phoneme).
  3. Divisió prosódica. Es dividix el text en unitats prosódicas, tals com unitats sintagmáticas, proposicions i frases.
  • En la segona fase, la que forma el sintetisador pròpiament dit, pren com a entrada la representació llingüística simbòlica i la transforma en veu sintètica.

Vore també

[editar | editar còdic]