Desambiguación lèxica basada en finestra deslizante
La desambiguación lèxica basada en finestra deslizante és un método per a desambiguación lèxica. La desambiguación lèxica assigna la categoria gramatical correcta a cada paraula d'un text.
Un percentage important (típicament al voltant del 30%, pero depenent de l'idioma) de les paraules en llenguage natural són paraules a les que, independentment del context, se'ls pot assignar més d'un anàlisis morfològic. La correcta resolució d'este tipo d'ambigüitat és crucial en la majoria d'aplicacions de processament del llenguage natural. Per eixemple, en traducció automàtica, la traducció equivalent d'un terme pot ser diferent en funció de la categoria gramatical de la paraula.
El etiquetador basat en finestra deslizante és un sistema que assigna una categoria gramatical a una paraula, basat en l'informació que proporciona una finestra de tamany fix formada per les paraules al voltant de la paraula que desigem desambiguar.
Les seues sigles en anglés serien SWPoST (Sliding Window Part-of-Speech Tagger).
Els seus dos principals ventages serien:
- es pot entrenar de forma automàtica, evitant l'etiquetage manual d'un corpus
- este etiquetador es pot implementar com un autómata d'estats finitos (una Màquina de Mealy).
Definició formal
[editar | editar còdic]Siga Γ = {γ1,γ2,...,γ|Γ|} el conjunt d'etiquetes de l'aplicació, és dir, el conjunt de possibles etiquetes que es pot assignar a una paraula, i W = {w1,w2,...} el vocabulari de l'aplicació. Siga T : W → Ρ(Γ) una funció d'anàlisis morfològic que assigna a cada paraula w el seu conjunt de possibles etiquetats T(w) ⊆ Γ, que pot ser implementada per mig d'un lexicón o un analisador morfològic. Siga Σ = {σ1,σ2,..., σ|Σ|} el conjunt de classes de paraules, que en general serà una partició de W en l'única restricció de que, per a tota σ ∈ Σ totes les paraules w Σ σ reben el mateix conjunt d'etiquetages, és dir, totes les paraules en cada classe de paraula (σ) pertanyguen a la mateixa classe d'ambigüitat. Normalment es construïx Σ de manera que, per a paraules en alta freqüència d'aparició, cada classe de paraules conté una única paraula, mentres que per a paraules en poca freqüència, cada classe de paraules es fa correspondre exactament en una classe d'ambigüitats, lo que permet un excelent funcionament en les paraules ambigües més freqüents, al mateix temps que no són necessaris massa paràmetros per al funcionament del etiquetador.
En estes deficiones es pot plantejar el problema del etiquetador lèxic de la següent forma: donat un text w[1]w[2]...w[L] ∈ W*, se li assigna a cada paraula w[t] (per mig d'un lexicon o un analisador morfològic) una classe de paraula T(w[t]) ∈ Σ per a obtindre un text etiquetat ambiguamente σ[1]σ[2]...σ[L] ∈ W*. La funció del etiquetador lèxic és obtindre un text etiquetat γ[1]γ[2]...γ[L] (en γ[t] ∈ T(σ[t])) lo més correcte possible.
Un etiquetador estadístic busca l'etiquetage lèxic 'més provable' d'un text σ[1]σ[2]...σ[L] etiquetat ambiguamente:
que per mig de la fòrmula de Bayes es convertix en:
a on p(γ[1]γ[2]...γ[L]) és la provabilitat d'un etiquetage en particular (provabilitat sintàctica) i p(σ[1]...σ[L]γ[1]...γ[L]) és la provabilitat de que eixe etiquetage siga el corresponent al text σ[1]...σ[L] (provabilitat lèxica).
En un Model de Markov estes provabilitats s'aproximen com a productes. Les provabilitats sintàctiques es modelen per mig d'un procés de Markov de primer orde:
a on γ[0] i γ[L+1] són símbols delimitadors.
Les provabilitats lèxiques són independents del context:
Una forma d'etiquetage és aproximar la primera fòrmula de provabilitat:
a on és el 'context esquerre' de tamany N(-)
i
és el 'context dret' de tamany N(+).
D'esta manera l'algoritme de finestra deslizante solament té en conte un context de tamany N(-)+N(+)+1. Per a la majoria de les aplicacions N(-)=N(+)=1. Per eixemple per a etiquetar la paraula ambigua 'va vindre' en la frase 'el vi d'Alacant', es tindria en conte l'etiquetage de les paraules 'el' i 'de'.
Vore també
[editar | editar còdic]Referències
[editar | editar còdic]- Unsupervised training of a finite-state sliding-window part-of-speech tagger, Enrique Sánchez-Villamil, Mikel L.Forcada i Rafael C. Carrasco
- Este artícul conté una traducció derivada de «Desambiguación léxica basada en ventana deslizante» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.