Anar al contingut

Stable Diffusion

De L'Enciclopèdia, la wikipedia en valencià
Stable Diffusion

Stable Diffusion és un model d'aprenentage automàtic desenrollat per Runway i LMU Munich[1] per a generar imàgens digitals d'alta calitat a partir de descripcions en llenguage natural o estímuls (prompts, en anglés). El model es pot usar per a diferents tasques, com la generació de traduccions d'image a image guiades per mensages de text i la millora d'imàgens.

A diferència de models de la competència com DALL-E, Stable Diffusion és de còdic obert[2] i no llimita artificialment les imàgens que produïx.[3] Els crítics han expressat la seua preocupació per l'ètica de la IA, afirmant que el model es pot utilisar per a crear deepfakes.[4] Pot eixecutar-se en l'hardware de l'usuari equipat en una targeta gràfica (GPU), és completament debades, es pot accedir a ell en llínea i va ser elogiat per PC World com «la pròxima aplicació revolucionària per a la seua PC».[5] Des del seu llançament inicial, més de 200.000 persones han descarregat el còdic.[6] El model original va ser lliberat a través de la colaboració de les comunitats CompVis LMU, Runway, i Stability AI, en el respal d'EleutherAI i LAION.

Arquitectura

[editar | editar còdic]

Stable Diffusion utilisa una variant del model de difusió (DM), denominada model de difusió latent (LDM).[7] Introduïts en 2015, els models de difusió s'entrenen en l'objectiu d'eliminar aplicacions successives de soroll gaussiano en les imàgens d'entrenament, que poden considerar-se una seqüència d'autocodificadores d'eliminació de soroll. Stable Diffusion consta de tres parts: l'autocodificador variacional (VAE), U-Net i un codificador de text opcional.[8] El codificador VAE comprimix l'image des de l'espai de píxels a un espai latent de dimensions més menudes, capturant un significat semàntic més fonamental de l'image.[9] El soroll gaussiano s'aplica iterativamente a la representació latent comprimida durant la difusió directa[8] El bloc U-Net, compost per una columna vertebral ResNet, elimina el soroll de l'eixida de la difusió directa cap a arrere per a obtindre la representació latent. Per últim, l'descodificador VAE genera l'image final convertint la representació de nou a l'espai de píxels[8] El pas d'eliminació de soroll pot condicionar-se de forma flexible a una cadena de text, una image i atres modalitats. Les senyes de condicionamiento codificats s'exponen a les U-Nets d'eliminació de soroll per mig d'un mecanisme d'atenció creuada.[8] Per a condicionar el text, s'utilisa el codificador de text fix i preentrenado CLIP ViT-L/14 per a transformar les indicacions de text a un espai de incrustación[1]. Els investigadors senyalen la major eficiència computacional per a l'entrenament i la generació com una ventaja dels LDM.[10][11]

Senyes d'entrenament

[editar | editar còdic]
Eixemple d'image generada per Stable Diffusion
Una image a l'estil pintura digital sobre el disseny urbà
Eixemple d'image generada per Stable Diffusion
Una image a l'estil Beksiński

Archiu:Animation of Stable Diffusion generation (gradual generative conceptual manifestation into fantasy art works).webm

Stable Diffusion es va entrenar en parells d'imàgens i subtítuls extrets de la base de senyes LAION-5B, un conjunt de senyes d'accés públic derivat de les senyes de Common Crawl extrets de la web, en el que es varen classificar 5.000 millons de parells image-text en funció de l'idioma, es varen filtrar en conjunts de senyes separades per resolució, es va predir la provabilitat de que contingueren una marca d'aigua i es va predir la puntuació "estètica" (per eixemple, la calitat visual subjectiva).[12][13] El conjunt de senyes va ser creat per LAION, una organisació alemana sense ànim de lucre que rep finançació de Stability AI.[12][13] El model Stable Diffusion es va entrenar en tres subconjunts de LAION-5B: laion2B-és, laion-high-resolution i laion-aesthetics v2 5+. Un anàlisis de tercers de les senyes d'entrenament del model va identificar que d'un subconjunt més chicotet de 12 millons d'imàgens preses del conjunt de senyes original més ampli utilisat, aproximadament el 47 % del tamany de la mostra d'imàgens procedia de 100 dominis diferents, dels quals Pinterest ocupava el 8,5 % del subconjunt, seguit de llocs web com WordPress, Blogspot, Flickr, DeviantArt i Wikimedia Commons.[14]

Procediments d'entrenament

[editar | editar còdic]

El model es va entrenar inicialment en els subconjunts laion2B-és i laion-high-resolution, i les últimes rondes d'entrenament es varen realisar en LAION-Aesthetics v2 5+, un subconjunt de 600 millons d'imàgens subtitulades a les que LAION-Aesthetics Predictor V2 va predir que els humans donarien, de mija, una puntuació d'a lo manco 5 sobre 10 quan se'ls demanara que valoraren quànt els agradaven.[15][16] El subconjunt LAION-Aesthetics v2 5+ també excloïa les imàgens de baixa resolució i les imàgens que LAION-5B-WatermarkDetection identificava com a portadores d'una marca d'aigua en una provabilitat superior al 80 %.[12] En les rondes finals d'entrenament es va eliminar ademés un 10 % de condicionamiento de text per a millorar l'orientació de difusió sense classificador.[17]


El model es va entrenar utilisant 256 GPU Nvidia A100 en Amazon Web Services, lo que va supondre un total de 150.000 hores de GPU, en un cost de 600.000 dólars.[18][19][20]

El còdic i pesos ('pretrained weights') del model de Stable Diffusion són de domini públic, i pot eixecutar-se en la majoria de l'hardware de consum equipat en una GPU en a lo manco 8 GB de VRAM.

Vore també

[editar | editar còdic]

Referències

[editar | editar còdic]
  1. «The research origins of Stable Diffusion | Runway Research» (en en-us). Runway. Consultat el 2023-03-19.
  2. «Stable Diffusion Public Release». Stability.Ai. Consultat el 2022-08-31.
  3. «Ready or not, mass video deepfakes llaure coming». The Washington Post. Consultat el 2022-08-31.
  4. «Deepfakes for all: Uncensored AI art model prompts ethics questions». TechCrunch. Consultat el 2022-08-31.
  5. «The new killer app: Creating AI art will absolutely crush your PC». PCWorld. Consultat el 2022-08-31.
  6. «[1]». Consultat el 24 d'octubre de 2022.
  7. Erro en la seqüencia d'órdens: no existix el mòdul «Citas».
  8. 8,0 8,1 8,2 8,3 «The Illustrated Stable Diffusion». jalammar.github.io. Consultat el 2023-01-06.
  9. «High-Resolution Image Synthesis with Latent Diffusion Models» (en en-us). Computer Vision & Learning Group. Consultat el 2023-01-06.
  10. «Stable Diffusion launch announcement» (en en-gb). Stability AI. Consultat el 2023-01-06.
  11. Rombach; Blattmann; Lorenz; Esser; Ommer (June 2022). High-Resolution Image Synthesis with Latent Diffusion Models (PDF). International Conference on Computer Vision and Pattern Recognition (CVPR). New Orleans, LA. pp. 10684–10695. arXiv:2112.10752.
  12. 12,0 12,1 12,2 «Exploring 12 Million of the 2.3 Billion Images Used to Train Stable Diffusion's Image Generator» (en en-us). Waxy.org. Consultat el 2023-01-05.
  13. 13,0 13,1 «This artist is dominating AI-generated art. And he’s not happy about it.» (en en). MIT Technology Review. Consultat el 2023-01-05.
  14. «Stable Diffusion: Tutorials, Resources, and Tools» (en en-us). Stack Diary. Consultat el 2023-01-05.
  15. Erro en la seqüencia d'órdens: no existix el mòdul «Citas».
  16. «LAION-Aesthetics | LAION» (en en). laion.ai. Consultat el 2023-01-05.
  17. arXiv:2207.12598 [cs].Consultat el 2023-01-05.
  18. «https://twitter.com/emostaque/status/1563870674111832066» (en és). Twitter. Consultat el 2023-01-05.
  19. «CompVis/stable-diffusion-v1-4 · Hugging Face». huggingface.co. Consultat el 2023-01-05.
  20. «A startup wants to democratize the tech behind DALL-E 2, consequences be damned» (en en-us). TechCrunch. Consultat el 2023-01-05.


Referències

[editar | editar còdic]