Web scraping

Web scraping o raspat web és una tècnica utilisada per mig de programes de software per a extraure informació de llocs web.[1] Usualment, estos programes simulen la navegació d'un humà en la World Wide Web ya siga utilisant el protocol HTTP manualment, o incrustant un navegador en una aplicació.
El web scraping està molt relacionat en la indexación de la web, la qual indexa l'informació de la web utilisant un robot i és una tècnica universal adoptada per la majoria dels motors de busca. No obstant, el web scraping s'enfoca més en la transformació de senyes sense estructura en la web (com el format HTML) en senyes estructurades que poden ser almagasenats i analisats en una base de senyes central, en una hoja o en alguna atra font d'almagasenament. Algun dels usos del web scraping són la comparació de preus en tendes, la monitorisació de senyes relacionades en el clima de certa regió, la detecció de canvis en llocs web i l'integració de senyes en llocs web. També és utilisat per a obtindre informació rellevant d'un lloc a través dels rich snippets.
Un raspador web utilisa l'URL d'un lloc web per a extraure senyes, almagasenant-los en una base de senyes o hoja local o central per a un anàlisis posterior. Este método d'web scraping permet l'extracció de senyes de manera eficient i precisa.[2]
En els últims anys l'web scraping s'ha convertit en una tècnica molt utilisada dins del sector del posicionament web gràcies a la seua capacitat de generar grans cantitats de senyes per a crear continguts de calitat.[3]
Tècniques
[editar | editar còdic]Web scraping és el procés de recopilar informació de forma automàtica de la Web. És un camp en desenrolls actius, compartint un propòsit en comú en la visió de la Web semàntica. Utilisa solucions pràctiques basades en tecnologies existents que són comunament ad hoc. Existixen distints nivells d'automatisació que les existents tecnologies d'Web Scraping poden brindar:
- «Copiar i pegar» humà: algunes voltes inclús les millors tècniques de web scraping no poden reemplaçar l'examen manual d'un humà, i a voltes esta pot ser l'única via de solució quan el lloc que tenim en ment posa certes barreres per a previndre que es creuen softwares per a realisar tasques automàtiques en est.
- Us d'expressions regulars: una possible via per a extraure informació de pàgines web poden ser les expressions regulars, encara que comunament no es recomana utilisar-les per a parsear el format HTML.
- Protocol HTTP: pàgines web estàtiques i dinàmiques poden ser obtingudes fent peticions HTTP al servidor remot utilisant sockets, etc.
- Algoritmes de mineria de senyes: molts llocs web tenen grans coleccions de pàgines generades dinàmicament a partir d'una base de senyes. Senyes de la mateixa categoria apareixen usualment en pàgines similars per mig d'un script o una plantilla. En la mineria de senyes, un programa detecta estes plantilles en un context específic i extrau el seu contingut.
- Parsers de HTML: Alguns llenguages, com XQuery i HTQL poden ser utilisats per a parsear documents, recuperar i transformar el contingut de documents HTML.
- Aplicacions per a web scraping: existixen moltes aplicacions disponibles que poden ser utilisades per a personalisar solucions d'Web Scraping. Estes aplicacions podrien reconéixer automàticament l'estructura de certa pàgina o brindar un interfaç a l'usuari a on este poguera seleccionar els camps que són d'interés dins del document. D'esta forma no és necessari escriure manualment còdic per a realisar estes tasques.
- Reconeiximent d'informació semàntica: les pàgines que són analisades podrien incloure metadatos o certa informació semàntica com a anotacions o comentaris, els quals poden ser usats comunament. Si estes anotacions estan en les mateixes pàgines, com succeïx en els microformatos, estes podrien ser d'utilitat quan parseamos el DOM del document. En un atre cas, les anotacions, organisades en una capa semàntica, són almagasenades i manejades de forma separada des d'atres pàgines, per lo que els scrapers poden recuperar estos esquemes i les instruccions des d'esta capa abans d'analisar els documents.[4]
Qüestions llegals
[editar | editar còdic]El web scraping podria anar en contra dels térmens d'us d'alguns llocs web. El compliment d'estos térmens no està totalment clar.[5] Mentres que la duplicació d'expressions originals pot ser en molts casos illegal, en Estats Units els tribunals varen dictar en el cas Feist Publications v. Rural Telephone Service que la duplicació de fets és permesa. Els tribunals d'Estats Units en certes ocasions han reconegut que certs usos dels scrapers no deurien estar permesos. Podria considerar-se una computadora com una propietat personal, i d'esta forma el scraper estaria entrant sense autorisació en esta propietat. En el cas més conegut, eBay vs Bidder's Edge, la segona empresa va tindre que parar de realisar peticions automàtiques al lloc de eBay. En este cas, Bidder's Edge licitava automàticament per certs productes en este lloc.
Una de les principals proves de scraping va involucrar a American Airlines i a una empresa anomenada FareChase. American Airlines va guanyar esta batalla, fent que FareChase parara de vendre un software que els permetia als usuaris comparar tarifes en llínea si el lloc de American Airlines era inclós. L'aerollínia va dir que les busques de FareChase entrabar sense autorisació en els servidors quan recopilaven l'informació públicament disponible.
Encara que les decisions actualment preses no són uniformes, és difícil ignorar que un patró està emergint, en el qual podem vore que els tribunals estan preparant-se per a protegir el contingut propietari en llocs web comercials, preveent d'esta forma que est siga utilisat sense el consentiment dels propietaris dels llocs. No obstant, el grau de protecció d'estos continguts encara no està establit, i dependrà del tipo d'accés realisat pels scrapers, de la cantitat d'informació recopilada i del grau en el que afecten estos factors al propietari del sitie web.
Vore també
[editar | editar còdic]- Mineria de senyes
- Mashup (aplicació web híbrida)
- Spamdexing
- Corpus llingüístic
- Arrapa web
- Metadato
- Screen scraping.
Referències
[editar | editar còdic]
Referències
[editar | editar còdic]- ↑ Erro en la cita: L'element
<ref>no és vàlit; puix no n'hi ha una referència en text nomenada(1) Martí, Sitelabs, 2016 - ↑ IEEE.
- 1–6.doi:10.1109/ICCCI.2019.8821809.Consultat el 2024-03-01.
- ↑ Erro en la cita: L'element
<ref>no és vàlit; puix no n'hi ha una referència en text nomenada(2) Martí, Sitelabs, 2016 - ↑ «What is FreeFormat» (en en). www.gooseeker.com. Consultat el 2024-05-15.
- ↑ «FAQ about Linking -- Chilling Effects Clearinghouse». web.archive.org. Archivat des d'el original, el 8 de març de 2002. Consultat el 2024-05-15.
- Este artícul conté una traducció derivada de «Web scraping» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.