AI ചിത്രങ്ങൾ എങ്ങനെ ഉണ്ടാക്കുന്നു?
ടെക്സ്റ്റിൽ നിന്ന് ചിത്രത്തിലേക്ക്
ഒരു വാചകം ടൈപ്പ് ചെയ്താൽ അതിനനുസരിച്ച് പുതിയ ചിത്രം സൃഷ്ടിക്കുന്ന AI ടൂളുകൾ ("ടെക്സ്റ്റ്-ടു-ഇമേജ്" മോഡലുകൾ) കഴിഞ്ഞ കുറച്ച് വർഷങ്ങളായി വളരെ പ്രചാരത്തിലായി. DALL·E, Stable Diffusion, Midjourney തുടങ്ങിയവ ഇത്തരം ടൂളുകൾക്ക് ഉദാഹരണങ്ങളാണ്. ഇവ എങ്ങനെ പ്രവർത്തിക്കുന്നു എന്ന് മനസ്സിലാക്കുന്നത്, ഇവയിൽ നിന്ന് നല്ല ഫലം എങ്ങനെ നേടാം, ഇവയുടെ പരിമിതികൾ എന്തൊക്കെയാണ് എന്ന് അറിയാൻ സഹായിക്കും.
"ഡിഫ്യൂഷൻ" (Diffusion) എന്ന സാങ്കേതികവിദ്യ
ഇന്നത്തെ മിക്ക AI ചിത്ര ജനറേറ്ററുകളും "ഡിഫ്യൂഷൻ മോഡലുകൾ" ആണ്. ഇതിന്റെ അടിസ്ഥാന ആശയം രസകരമാണ് — പരിശീലന സമയത്ത്, ഒരു യഥാർത്ഥ ചിത്രത്തിലേക്ക് ക്രമേണ "നോയ്സ്" (noise, അതായത് ക്രമരഹിതമായ പിക്സൽ വ്യതിയാനങ്ങൾ) ചേർത്ത്, ഒടുവിൽ ചിത്രം പൂർണ്ണമായും നോയ്സ് മാത്രമായി മാറ്റുന്നു. മോഡൽ ഈ പ്രക്രിയ "തിരിച്ചെടുക്കാൻ" — അതായത്, നോയ്സിൽ നിന്ന് തിരികെ യഥാർത്ഥ ചിത്രത്തിലേക്ക് പോകാൻ — പരിശീലിക്കുന്നു. ഇത് പഠിച്ചുകഴിഞ്ഞാൽ, പുതിയ ഒരു ചിത്രം ഉണ്ടാക്കാൻ, മോഡൽ പൂർണ്ണമായും ക്രമരഹിതമായ നോയ്സിൽ നിന്ന് തുടങ്ങി, ഘട്ടംഘട്ടമായി അതിനെ ഒരു അർത്ഥവത്തായ ചിത്രമായി "ശുദ്ധീകരിക്കുന്നു" — നിങ്ങൾ നൽകിയ ടെക്സ്റ്റ് പ്രോംപ്റ്റിന്റെ മാർഗ്ഗനിർദ്ദേശത്തോടെ.
ടെക്സ്റ്റും ചിത്രവും തമ്മിലുള്ള ബന്ധം എങ്ങനെ പഠിക്കുന്നു?
ഇത്തരം മോഡലുകൾ പരിശീലിപ്പിക്കുന്നത് ദശലക്ഷക്കണക്കിന് ചിത്രം-അടിക്കുറിപ്പ് ജോഡികൾ (image-caption pairs) ഉപയോഗിച്ചാണ് — ഓരോ ചിത്രത്തിനും അതിനെ വിവരിക്കുന്ന ഒരു ടെക്സ്റ്റ് അടിക്കുറിപ്പും ഒപ്പം നൽകും. ഈ ജോഡികളിലൂടെ കടന്നുപോകുമ്പോൾ, മോഡൽ ഏതൊക്കെ ദൃശ്യരൂപങ്ങളാണ് ഏതൊക്കെ വാക്കുകളുമായി ബന്ധപ്പെട്ടിരിക്കുന്നത് എന്ന് പഠിക്കുന്നു — ഉദാഹരണത്തിന്, "ചുവപ്പ്" എന്ന വാക്ക് എങ്ങനെയുള്ള നിറങ്ങളുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു, "പൂച്ച" എന്ന വാക്ക് എങ്ങനെയുള്ള ആകൃതികളുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു എന്നിങ്ങനെ. ഇതിലൂടെയാണ് മോഡലിന് ഒരു പുതിയ ടെക്സ്റ്റ് പ്രോംപ്റ്റ് വായിച്ച്, അതിനോട് യോജിക്കുന്ന ഒരു പുതിയ ചിത്രം "സങ്കൽപ്പിച്ചുണ്ടാക്കാൻ" കഴിയുന്നത്.
നല്ല ചിത്രം കിട്ടാൻ പ്രോംപ്റ്റ് എങ്ങനെ എഴുതണം?
- വിഷയം (ആരാണ്/എന്താണ് ചിത്രത്തിൽ) വ്യക്തമായി പറയുക
- ശൈലി (ഫോട്ടോറിയലിസ്റ്റിക്, കാർട്ടൂൺ, പെയിന്റിംഗ്, 3D) വ്യക്തമാക്കുക
- പശ്ചാത്തലം, ലൈറ്റിംഗ്, നിറങ്ങൾ എന്നിവ വിവരിക്കുക
- ക്യാമറ ആംഗിൾ അല്ലെങ്കിൽ കോമ്പോസിഷൻ ആവശ്യമെങ്കിൽ പറയുക
- ഒരു ചിത്രം കിട്ടിക്കഴിഞ്ഞാൽ, പ്രോംപ്റ്റ് ചെറുതായി മാറ്റി വീണ്ടും ശ്രമിക്കുക
പരിമിതികളും ധാർമ്മിക പ്രശ്നങ്ങളും
AI ചിത്ര ജനറേറ്ററുകൾക്ക് ചില പൊതുവായ ബലഹീനതകളുണ്ട് — കൈകൾ, വിരലുകൾ, ടെക്സ്റ്റ് എന്നിവ ചിലപ്പോൾ വികലമായി വരാം, സങ്കീർണ്ണമായ രംഗങ്ങളിൽ വസ്തുക്കളുടെ എണ്ണമോ സ്ഥാനമോ തെറ്റാം. കൂടാതെ, ഈ മോഡലുകൾ പരിശീലിപ്പിച്ച ഡാറ്റയിൽ പകർപ്പവകാശമുള്ള ചിത്രങ്ങൾ ഉൾപ്പെട്ടിരിക്കാം എന്നത് ഒരു ധാർമ്മിക-നിയമപരമായ ചർച്ചാവിഷയമാണ്. ഒരു യഥാർത്ഥ വ്യക്തിയുടെ മുഖം അനുവാദമില്ലാതെ ഉപയോഗിച്ച് വ്യാജ ചിത്രങ്ങൾ ഉണ്ടാക്കുന്നതും ഗുരുതരമായ ധാർമ്മിക-സ്വകാര്യതാ പ്രശ്നമാണ്. AI ജനറേറ്റഡ് ചിത്രങ്ങൾ പങ്കുവയ്ക്കുമ്പോൾ അത് വ്യക്തമായി സൂചിപ്പിക്കുന്നത് നല്ല ശീലമാണ്.
ഉപസംഹാരം
AI ചിത്ര ജനറേഷൻ, നോയ്സിൽ നിന്ന് ക്രമേണ ഒരു അർത്ഥവത്തായ ചിത്രം "ശുദ്ധീകരിച്ചെടുക്കുന്ന" ഡിഫ്യൂഷൻ എന്ന സാങ്കേതികവിദ്യയിലാണ് അധിഷ്ഠിതം. ചിത്രം-ടെക്സ്റ്റ് ജോഡികളിൽ നിന്ന് പഠിച്ച ബന്ധങ്ങൾ ഉപയോഗിച്ചാണ് ഇത് നിങ്ങളുടെ പ്രോംപ്റ്റിനോട് യോജിക്കുന്ന പുതിയ ചിത്രങ്ങൾ സൃഷ്ടിക്കുന്നത്. നല്ല പ്രോംപ്റ്റുകൾ എഴുതി, ഇതിന്റെ പരിമിതികളും ധാർമ്മിക വശങ്ങളും മനസ്സിലാക്കി ഉപയോഗിക്കുന്നതാണ് ബുദ്ധിപൂർവ്വകം.