Anar al contingut

Dall-i

De L'Enciclopèdia, la wikipedia en valencià
Archiu:DALL-E 2 artificial intelligence digital image generated photo.jpg
Dall-i

DALL-E (estilisat DALL·I) és un model d'inteligència artificial de generació imàgens a partir de descripcions textuals o estímuls (prompt en anglés), revelades per OpenAI el 5 de giner de 2021.[1] Utilisa GPT [2]per a interpretar i entendre les entrades del llenguage natural (com «un bosso de cuiro vert en forma de pentàgon» o «una vista isomètrica d'un capibara trist») i generar les corresponents imàgens.[3] Pot crear des d'imàgens d'objectes realistes (com «una vidriera policromada en l'image d'una fraula blava»), aixina com objectes que no existixen en la realitat (com «una gaveta en la textura d'un puercoespín»).[4][5][6] El seu nom és un acrònim de WALL·I i Salvador Dalí.[2][3]

Microsoft va implementar el model en la ferramenta Image Creator de Bing i planeja implementar-ho en la seua aplicació Designer.[7]

Moltes rets neuronals artificials des de la década de 2000 en avant han pogut generar imàgens realistes.[3] DALL-E, no obstant, és capaç de generar-los a partir d'indicacions de llenguage natural, que «comprén [...] i rara volta falla de manera important».[3]


DALL-E va ser desenrollat i anunciat al públic en conjunt a CLIP (Contrastive Language-Image Pre-training o Pre-entrenament d'Image-Llenguage Contrastante),[1] un model separat la funció del qual és «comprendre i classificar» el seu resultat.[3] Les imàgens que genera DALL-E estan seleccionades per CLIP, que presenta les imàgens de més alta calitat.[1] OpenAI s'ha negat a publicar el còdic font de qualsevol dels models; una «demostració controlada» de DALL-E està disponible en el lloc web de OpenAI, a on es pot vore l'eixida d'una selecció llimitada de mensages de mostra.[2] Les comunitats han publicat alternatives de còdic obert, capacitades en cantitats més chicotetes de senyes, com DALL-E Mini.[8]

Segons MIT Technology Review, un dels objectius de OpenAI era «donar als models de llenguage una millor comprensió dels conceptes quotidians que els humans usen per a donar sentit a les coses».[1]

Arquitectura

[editar | editar còdic]
Archiu:CLIP3 example DALL-Egenerated image.png
Una image generada per DALL•I despuix d'escriure el mensage de text: «Un edifici arquitectònic modern en grans finestrals de vidre, situat en un penya-segat en vista a un oceà seré a la vespradeta».
Archiu:1960's art of cow getting abducted by DALLin midwest.jpg
Una image generada en DALL•I 2 basada en el text: «Art dels anys 60 d'una vaca seqüestrada per un ovni en el mig oest».


Artícul principal → GPT-3.

El model Generative Pre-Training Transformer (GPT) va ser desenrollat inicialment per OpenAI en 2018,[9] utilisant l'arquitectura Transformer. La primera iteración, GPT, es va ampliar per a produir GPT-2 en 2019;[10] en 2020 es va tornar a ampliar per a produir GPT-3.[11][2][12]

El model de DALL-E és una implementació multimodal de GPT-3[13] en 12 mil millons de paràmetros[2] (reduït dels 175 mil millons de GPT-3)[11] que «intercanvia text per píxels», entrenat en parells text-image d'Internet.[1] Utilisa l'aprenentage zero-shot per a generar resultats a partir d'una descripció i una pista sense més entrenament.[14]


DALL-E genera una gran cantitat d'imàgens en resposta a unes indicacions. Un atre model OpenAI, CLIP, es va desenrollar junt (i es va anunciar simultàneament) en DALL-E per a «comprendre i classificar» este resultat.[3] CLIP es va entrenar en més de 400 millons de parells d'imàgens i text.[2] CLIP és un sistema de reconeiximent d'imàgens;[15] no obstant, a diferència de la majoria dels models de classificadors, CLIP no va ser entrenat en conjunts de senyes seleccionades d'imàgens etiquetades (com ImageNet), sino en imàgens i descripcions extretes d'Internet.[1] En lloc de deprendre d'una sola etiqueta, CLIP associa imàgens en subtítuls complets.[1] CLIP es va entrenar per a predir qué subtítul (d'una «selecció aleatòria» de 32.768 subtítuls possibles) era el més apropiat per a una image, lo que li permetia identificar posteriorment objectes en una àmplia varietat d'imàgens fòra del seu conjunt d'entrenament.[1]

Funcionament

[editar | editar còdic]
Archiu:CLIPsample.png
Imàgens produïdes per DALL-E en indicar-li que representara «una ilustració professional en alta calitat d'una girafa dragó quimera. una girafa imitant a un dragó. una girafa feta de dragó»


DALL-E és capaç de generar imàgens en una varietat d'estils, des d'imàgens fotorrealistas[2] fins a pintures i emoji. També pot «manipular i reorganisar» objectes en les seues imàgens.[2] Una habilitat captada pels seus creadors va ser la correcta colocació d'elements dissenyats en composicions noves sense instruccions explícites: «Per eixemple, quan se li demana que dibuixe un rave japonés sonant-se el nas, prenent un café en llet o montant un monociclo, DALL · I a sovint dibuixa el mocador, mans i peus en llocs plausibles».[16] Si ben DALL-E va exhibir una àmplia varietat de destrea i habilitats, en el seu llançament públic, la major part de la cobertura es va centrar en un chicotet subconjunt d'imàgens d'eixida «surrealistes»[1] o «extravagants».[17] Específicament, la producció de DALL-E per a «una ilustració d'un rave japonés bebé en un tutú passejant a un gos» es va mencionar en peces de Input,[18] NBC,[19] Nature,[20] VentureBeat,[2] Wired,[21] CNN,[22] New Scientist[23] i la BBC.[24] El seu resultat de «un silló en la forma d'un albocat» va ser presentat per Wired,[21] VentureBeat,[2] New Scientist,[23] NBC,[19] MIT Technology Review,[1] CNBC,[17] CNN[22] i BBC.[24] En contrast, l'ingenier d'aprenentage automàtic Dona-li Markowitz va informar sobre el desenroll involuntari de les habilitats de raonament visual de DALL-E suficients per a resoldre les Matrius de Raven (proves visuals que a sovint s'administren a humans per a medir l'inteligència) en un artícul per a TheNextWeb.[25]

Nature va presentar DALL-E com «un programa d'inteligència artificial que pot dibuixar pràcticament qualsevol cosa que demane».[20] Thomas Macaulay de TheNextWeb va calificar les seues imàgens de «impactants» i «realment impressionants», i va destacar la seua capacitat per a «crear imàgens completament noves per mig de l'exploració de l'estructura d'un mensage, inclosos objectes fantàstics que combinen idees no relacionades que mai es varen alimentar en l'entrenament».[26] ExtremeTech va dir que «a voltes les representacions són una miqueta millors que pintar en els dits, pero atres voltes són representacions sorprenentment precises»;[27] TechCrunch va senyalar que, si ben DALL-E era «un treball fabulosamente interessant i poderós», ocasionalment produïa estranyes o incomprensibles eixida, i «moltes imàgens que genera estan més que una miqueta ... apagades»:[3]

Dir «un bosso de cuiro vert en forma de pentágon» pot produir lo que s'espera, pero «un bosso de gamuza blau en forma de pentàgon» pot produir malensomis. ¿Per qué? És difícil de dir, donada la naturalea de caixa negra d'estos sistemes.[3]


Archiu:DALL-E(sample).jpg
Eixemple d'imàgens generades per DALL-E a partir de les següents instruccions:[28]
* una biblioteca medieval a la llum de la lluna;
* una biblioteca medieval a la llum de la lluna (mateixes instruccions);
* un còdex sobre una taula en una biblioteca medieval;
* un monge copista treballant a la llum d'una vela;
* la silueta d'un monge cisterciense parcialment oculta despuix d'una cortina;
* primer pla de la mànega d'un monge cisterciense que sosté en la seua mà una daga;
* claroscuro d'un monge cisterciense tendit en el sol;
* claroscuro d'una daga en el sol;
* silueta d'un monge cisterciense portant un còdex en un passadiç obscur.

A pesar d'açò, DALL-E va ser descrit com «notablement robust a tals canvis» i confiable en la producció d'imàgens per a una àmplia varietat de descripcions arbitràries.[3] Sam Shead, que informa para CNBC, va calificar les seues imàgens de «extravagants» i va citar a Neil Lawrence, professor d'aprenentage automàtic en l'Universitat de Cambridge, qui ho va descriure com una «demostració inspiradora de la capacitat d'estos models per a almagasenar informació sobre el nostre món i generalisar en formes que els humans troben molt naturals». Shead també va citar a Mark Riedl, professor associat de l'Escola de Computació Interactiva de Geòrgia Tech, dient que els resultats de la demostració de DALL-E varen demostrar que era capaç de «combinar conceptes de manera coherent», un element clau de la creativitat humana, i que «la demo de DALL -I és destacable per produir ilustracions que són molt més coherents que atres sistemes Text2Image que he vist en els últims anys».[17] Riedl també va ser citat per la BBC dient que estava «impressionat per lo que el sistema podia fer».[24]

També es va destacar la capacitat de DALL-E per a «completar els espais en blanc» i introduir detalls apropiats sense indicacions específiques. ExtremeTech va notar que una indicació per a dibuixar «un pingüí en un jersei nadalenc» produïa imàgens de pingüins que no solament usant un jersei, sino també capells de Santa,[27] i Engadget va senyalar que varen aparéixer ombres apropiadament colocades en els resultats del mensage «una pintura d'un rabosot assentat en un camp durant l'hivern».[14] Ademés, DALL-E exhibix una àmplia comprensió de les tendències visuals i de disseny; ExtremeTech va dir que «pot demanar-li a DALL-E una image d'un teléfon o una aspiradora d'un periodo de temps específic, i entén cóm han canviat eixos objectes».[27] Engadget també va senyalar la seua capacitat inusual de «comprendre cóm els teléfons i atres objectes canvien en el temps».[14] DALL-E ha segut descrit, junt en una atra «IA estreta» com AlphaGo, AlphaFold i GPT-3 com «[generant] interés en si i cóm es pot conseguir l'inteligència artificial forta».[29]

Transcendència

[editar | editar còdic]
Archiu:DALL-E3 DALL-Eimage of an avocado speaking.png
Una image generada per DALL-E 3 basada en el text precís: «Una ilustració d'un albocat assentat en la cadira d'un terapeuta, dient 'Em sent tan buit per dins' en un forat del tamany d'un clot en el centre. El terapeuta, que és una cullera, garabatea notes».

OpenAI s'ha negat a publicar el còdic font de DALL-E, ni a permetre el seu us fòra d'una chicoteta cantitat de solicituts de mostra;[2] OpenAI va afirmar que planejava «analisar els impactes socials»[26] i «el potencial de biaix» en models com DALL-E.[17] A pesar de la falta d'accés, s'ha discutit a lo manco una possible implicació de DALL-E, i varis periodistes i escritors de contingut prediuen principalment que DALL-E podria tindre efectes en el camp del periodisme i la redacció de contingut. L'artícul de Sam Shead en la CNBC va senyalar que alguns estaven preocupats per la llavors falta d'un artícul publicat que descriguera el sistema, i que DALL-E no havia segut «de còdic obert» [sic].[17]

Si ben TechCrunch va dir «no escrigues obituarios de fotografies i ilustracions d'archiu encara»,[3] Engadget va dir que «si es desenrolla més, DALL-E té un gran potencial per a alterar camps com la fotografia d'archiu i l'ilustració, en tot lo bo i lo mal que implica».[14]

En un artícul d'opinió de Forbes, el capitaliste de risc Rob Toews va dir que DALL-E «presagiava l'amanecer d'un nou paradigma de IA conegut com IA multimodal», en el que els sistemes serien capaços de «interpretar, sintetisar i traduir entre múltiples modalitats d'informació»; Va continuar dient que DALL-E va demostrar que «cada volta és més difícil negar que l'inteligència artificial és capaç de tindre creativitat». Sobre la base de les indicacions de mostra (que incloïen maniquins vestits i mobles), va predir que DALL-E podria ser utilisat per dissenyadors de moda i dissenyadors de mobles, pero que «la tecnologia va a seguir millorant ràpidament».[30]

Vore també

[editar | editar còdic]

Referències

[editar | editar còdic]
  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 Heaven, Will Douglas (2021-01-05). «This avocado armchair could be the future of AI». MIT Technology Review.
  2. 2,00 2,01 2,02 2,03 2,04 2,05 2,06 2,07 2,08 2,09 2,10 Johnson, Khari. «OpenAI debuts DALL-E for generating images from text». VentureBeat.
  3. 3,00 3,01 3,02 3,03 3,04 3,05 3,06 3,07 3,08 3,09 Coldewey, Devin. «OpenAI's DALL-E creates plausible images of literally anything you ask it to».
  4. Grossman, Gary. «OpenAI's text-to-image engine, DALL-E, is a powerful visual idea generator». VentureBeat.
  5. Andrei, Mihai. «This AI module ca create stunning images out of any text input». ZME Science.
  6. Walsh, Bryan (2021-01-05). «A new AI model draws images from text». Axios.
  7. «Announcing Microsoft Copilot, your everyday AI companion» (en en-us). The Official Microsoft Blog. Consultat el 2023-12-18.
  8. «DALL·I Mini».
  9. «Improving Language Understanding by Generative Pre-Training» págs. 12. OpenAI.
  10. Language models llaure unsupervised multitask learners” (14 de febrer 2019) 1 (8).
  11. 11,0 11,1 Plantilla:Cite arxiv
  12. Plantilla:Cite arXiv
  13. Plantilla:Cite arXiv
  14. 14,0 14,1 14,2 14,3 Dent, Steve (2021-01-06). «OpenAI's DALL-E app generates images from just a description». Engadget.
  15. «For Its Latest Trick, OpenAI's GPT-3 Generates Images From Text Captions». Synced.
  16. Dunn, Thom. «This AI neural network transforms text captions into art, like a jellyfish Pikachu». BoingBoing.
  17. 17,0 17,1 17,2 17,3 17,4 Shead, Sam (2021-01-08). «Why everyone is talking about an image generator released by an Elon Musk-backed A.I. lab». CNBC.
  18. Kasana, Mehreen. «This AI turns text into surreal, suggestion-driven art». Input.
  19. 19,0 19,1 Ehrenkranz, Melanie. «Here's DALL-E: An algorithm learned to draw anything you tell it». NBC News.
  20. 20,0 20,1 Stove, Emma (2021-02-05). «Tardigrade circus and a tree of life — January's best science images». Nature.
  21. 21,0 21,1 Knight, Will. «This AI Could Go From 'Art' to Steering a Self-Driving Car». Wired.
  22. 22,0 22,1 Metz, Rachel (2021-02-02). «A radish in a tutu walking a dog? This AI ca draw it really well». CNN.
  23. 23,0 23,1 Stokel-Walker, Chris (2021-01-05). «[https://www.newscientist.com/article/2264022-ai-illustrator-draws-imaginative-pictures-to-go-with-text-captions/ AI illustrator draws imaginative pictures to go with text captions]». New Scientist.
  24. 24,0 24,1 24,2 Wakefield, Jane (2021-01-06). «AI draws dog-walking baby radish in a tutu». British Broadcasting Corporation.
  25. Markowitz, Dona-li. «Here's how OpenAI's magical DALL-E image generator works». TheNextWeb.
  26. 26,0 26,1 Macaulay, Thomas (2021-01-06). «Say hello to OpenAI's DALL-E, a GPT-3-powered bot that creates weird images from text». TheNextWeb.
  27. 27,0 27,1 27,2 Whitwam, Ryan (2021-01-06). «OpenAI's 'DALL-E' Generates Images From Text Descriptions». ExtremeTech.
  28. Les instruccions donades en anglés són:
    a moonlit medieval library
    a moonlit medieval library (2)
    a codex on a table in a medieval library
    a copyist monk at work lit by a candle
    a figure of a Cistercian monk partially hidden behind a curtain
    close-up on the sleeve of a Cistercian monk holding a dagger in his hand
    chiaroscuro of a Cistercian monk lying on the ground
    chiaroscuro of a dagger on the floor
    figure of a Cistercian monk carrying a codex in a dark corridor.
  29. “Tim Taylor and Alan Dorin: Rise of the self-replicators—early visions of machines, AI and robots that ca reproduïx and evolve” (2021). Genetic Programming and Evolvable Machines 22: 141–145. doi:10.1007/s10710-021-09398-5.
  30. Toews, Rob (2021-01-18). «AI And Creativity: Why OpenAI's Latest Model Matters». Forbes.

Bibliografia

[editar | editar còdic]
  • Jens Knappe: Genesis. A Creation Story in Cooperation with an Artificial Intelligence, Berlín 2022, ISBN 978-3-940948-45-8.


Referències

[editar | editar còdic]