Anar al contingut

Tf-idf

De L'Enciclopèdia, la wikipedia en valencià

Tf-idf (de l'anglés Term frequency – Inverse document frequency), freqüència de terme – freqüència inversa de document (o siga, la freqüència d'ocurrència del terme en la colecció de documents), és una mida numèrica que expressa cuán rellevant és una paraula per a un document en una colecció. Esta mida s'utilisa a sovint com un factor de ponderació en la recuperació d'informació i la mineria de text. El valor tf-idf aumenta proporcionalment al número de voltes que una paraula apareix en el document, pero és compensada per la freqüència de la paraula en la colecció de documents, lo que permet manejar el fet de que algunes paraules són generalment més comunes que unes atres.[1]

Variacions de l'esquema de pes tf-idf són amprades freqüentment pels motors de busca com a ferramenta fonamental per a medir la rellevància d'un document donada una consulta de l'usuari, establint aixina una ordenació o rànquing dels mateixos. Tf-idf pot utilisar-se exitosamente per al filtrat de les denominades stop-words (paraules que solen usar-se en casi tots els documents), en diferents camps com la classificació i resum de text.[2]

Una de les funcions de rànquing més senzilles es calcula com la suma dels valors tf-idf de cada terme de la consulta. Moltes funcions de rànquing més complexes constituïxen variacions d'este simple model.

Motivació

[editar | editar còdic]

Supongam que tenim una colecció de documents i volem determinar el document més rellevant a la consulta "la mochila blava". Una manera senzilla de començar és eliminant aquells documents que no continguen les tres paraules "la", "mochila" i "blau", pero encara queden molts documents. Per a diferenciar-los encara més, devem contar el número de voltes que cada terme ocorre en cada document i sumar-los; el número de voltes que un terme ocorre en un document es denomina la seua freqüència de terme (tf).

No obstant, com el terme "la" és tan comú, açò provocarà que es destaquen incorrectament documents que utilisen de casualitat la paraula "la" en més freqüència, sense concedir suficient pes als térmens més significatius "mochila" i "blau". El terme "la" no és una bona paraula clau per a distinguir documents rellevants i no rellevants, a diferència de les paraules menys comunes "mochila" i "blau". Per lo tant, s'incorpora un factor de freqüència inversa de document que atenua el pes dels térmens que ocorren en molta freqüència en la colecció de documents i incrementa el pes dels térmens que ocorren poques voltes.

Detalls matemàtics

[editar | editar còdic]

Tf-idf és el producte de dos mides, freqüència de terme i freqüència inversa de document. Existixen vàries maneres de determinar el valor d'abdós. En el cas de la freqüència de terme tf(t, d), l'opció més senzilla és usar la freqüència bruta del terme t en el document d, o siga, el número de voltes que el terme t ocorre en el document d. Si denotem la freqüència bruta de t per f(t,d), llavors l'esquema tf simple és tf(t, d) = f(t,d). Atres possibilitats són:[3]

  • "freqüències" booleanas: tf(t,d) = 1 si t ocorre en d, i 0 si no;
  • freqüència escalada logarítmicamente: tf(t,d) = 1 + log f(t,d) (i 0 si f(t,d)=0);
  • freqüència normalisada, per a evitar una predisposició cap als documents llarcs. Per eixemple, es dividix la freqüència bruta per la freqüència màxima d'algun terme en el document:[4]
tf(t,d)=f(t,d)max{f(t,d):td}

La freqüència inversa de document és una mida de si el terme és comú o no, en la colecció de documents. S'obté dividint el número total de documents pel número de documents que contenen el terme, i es pren el logaritmo d'eixe cocient:

idf(t,D)=log|D||{dD:td}|

a on

  • |D|: cardinalidad de D, o número de documents en la colecció.
  • |{dD:td}| : número de documents a on apareix el terme t. Si el terme no està en la colecció es produirà una divisió-per-zero. Per lo tant, és comú ajustar esta fòrmula a 1+|{dD:td}|.

Matemàticament, la base de la funció logaritmo no és important i constituïx un factor constant en el resultat final.

Després, tf-idf es calcula com:

tfidf(t,d,D)=tf(t,d)×idf(t,D)

Un pes alt en tf-idf s'alcança en una elevada freqüència de terme (en el document donat) i una chicoteta freqüència d'ocurrència del terme en la colecció completa de documents. Com el cocient dins de la funció logaritmo del idf és sempre major o igual que 1, el valor del idf (i del tf-idf) és major o igual que 0. Quan un terme apareix en molts documents, el cocient dins del logaritmo s'acosta a 1, oferint un valor de idf i de tf-idf propenc a 0.

Vore també

[editar | editar còdic]

Bibliografia

[editar | editar còdic]
  1. Ounis, Iadh (2009). Inverse Document Frequency (en en), Springer US, pp. 1570–1571. doi:10.1007/978-0-387-39940-9_933. ISBN 978-0-387-35544-3.
  2. TF*IDF Ranker
  3. Manning, Raghavan and Schütze, p. 118.
  4. «Vector Models based on Normalized Frequencies». El meu Islita. Archivat des d'el original, el 8 de juny de 2012. Consultat el 17 d'agost de 2012.


Referències

[editar | editar còdic]