Classificador bayesiano ingenu
En teoria de la provabilitat i mineria de senyes, un classificador Naive Bayes és un classificador provabilístic fonamentat en el teorema de Bayes i algunes hipòtesis simplificadoras adicionals. És a causa d'estes simplificació, que se solen resumir en l'hipòtesis d'independència entre les variables predictoras, que rep l'apelatiu de naive, és dir, ingenu.
Introducció
[editar | editar còdic]En térmens simples, un classificador de Naive Bayes assumix que la presència o absència d'una característica particular no està relacionada en la presència o absència de qualsevol atra característica, donada la classe variable. Per eixemple, una fruta pot ser considerada com una poma si és roja, redona i d'al voltant de 7 cm de diàmetro. Un classificador de Naive Bayes considera que cada una d'estes característiques contribuïx de manera independent a la provabilitat de que esta fruta siga una poma, independentment de la presència o absència de les atres característiques.
Per a atres models de provabilitat, els classificadors de Naive Bayes es poden entrenar de manera molt eficient en un entorn d'aprenentage supervisat. En moltes aplicacions pràctiques, l'estimació de paràmetros per als models Naive Bayes utilisa el método de màxim verosimilitut, en atres paraules, es pot treballar en el model de Naive Bayes sense acceptar provabilitat bayesiana o qualsevol dels métodos bayesianos.
Una ventaja del classificador de Naive Bayes és que solament es requerix una chicoteta cantitat de senyes d'entrenament per a estimar els paràmetros (les miges i les varianza de les variables) necessàries per a la classificació. Com les variables independents s'assumixen, solament és necessari determinar les varianza de les variables de cada classe i no tota la matriu d'covarianza.
Concepte Provabilístic
[editar | editar còdic]En abstracte, el model de provabilitat per a un classificador és
sobre una variable depenent , en un chicotet número de resultats (o classes). Esta variable està condicionada per vàries variables independents des de a . El problema és que si el número de variables independents és gran (o quan estes poden prendre molts valors), llavors basar este model en taules de provabilitat es torna impossible. Per lo tant el model es reformula per a fer-ho més manejable:
Usant la teorema de Bayes s'escriu:
Lo anterior podria reescriure's en llenguage comú com:
En la pràctica solament importa el numerador, ya que el denominador no depén de i els valors de són senyes, per lo que el denominador és, en la pràctica, constant.
El numerador és equivalent a una provabilitat composta:
que pot ser reescrita com seguix, aplicant repetidament la definició de provabilitat condicional:
... i aixina successivament. Ara és quan el supòsit "naïve" d'independència condicional entra en joc: s'assumix que cada és independent de qualsevol atra per a quan estan condicionades a . Açò significa que
per lo que la provabilitat composta pot expressar-se com
Açò significa que fent estos supòsits, la distribució condicional de sobre les variables clasificatorias pot expressar-se de la següent manera:
a on és un factor que depén solament de , és dir, constant si els valors de són coneguts.
Vore també
[editar | editar còdic]- Classificador Knn
- Classificador llineal
- Ret bayesiana
- Teorema de Bayes
- Provabilitat a posteriori
- Provabilitat a priori
- Este artícul conté una traducció derivada de «Clasificador bayesiano ingenuo» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.