След като миналата седмица си поиграх с новия Higgsfield Plugin за DaVinci Resolve, реших че е време да видя докъде са стигнали моделите с функцията Replace.
Идеята е проста. Избирате си някакво истинско видео, може да е нещо снимано от вас, или каквото ви е на сърце, и казвате на модела да смени определен човек в него с друг персонаж, който вие му подавате. Не говорим за Face Swap, в който заменяте лицето на даден персонаж, а да замените цяла фигура с друга, като запазите цялото изпълнение – движения, жестове, мимики, начина на говорене, поведение пред камерата.
За тестовете използвах няколко различни видеа и различни персонажи. Не съм търсил политическа провокация, сензация или някакво скандално съдържание. Просто се насочих към разпознаваеми лица, защото когато всички знаем как изглежда даден човек, гледали сме го многократно, то тогава по-лесно можем да преценим дали моделът се е справил добре. Това е причината, не търсете под вола теле. Също така, гледах оригиналите да бъдат разнообразни, да има жестове, пеене, движение, говор...
Използвах три модела - Seedance 2.0, Kling 3.0 Motion Control и Wan 2.2 Animate.
За генериране на заместващи персонажи ползвах основно Nano Banana 2. Пробвах няколко различни варианти за генериране на кадри от ChatGPT Image Generation, обаче всеки път ме отрязваше с рестрикции за авторски права, за сензитивни кадри и прочие и накрая се отказах.
Същия проблем имах и когато генерирах видеата. Като цяло, най-силно ограничение даде най-силния модел, а именно Seedance 2.0. Това, което не мина при него, често минаваше при останалите два модела. Това обаче означава само, че рестрикциите са били преодолени, а не че крайният резултат непременно е бил добър. Тук оставям само сполучливите експерименти, като държа да отбележа, че несполучливите бяха доста много. Някои от тях бяха толкоз счупени, че съм се превивал от смях. Може би трябва да ги събирам и някой ден да направя клип от тях. Някакъв кратък хорър филм например.
Виждал съм в нета доста сполучливи неща, като вероятно причината на мен да не ми се получи чак толкова добре се крие в моята експертиза, в достъпването на моделите не директно, а през трета страна, в неправилни промптове и прочие. Специално за тези видеа, промптовете са ми били елементарни, замени човек Х, с човек от картинката която ти давам, като запазиш всичко в оригиналното видео. Единствено за Wan 2.2 Animate не съм писал промптове, защото модела така е зададен, че той върши само тази задача и му е ясно. За сметка на това, нито едно от видеата генерирани от този модел не можа да се класира за да го покажа.
Та, стига съм плямпал, ето ги четирите видеа.
Модел - Kling 3.0 Motion Control. Забележете как е спазил мимиките от лицето на Радев, повдигане на вежди, уста... Ллипсва прозорецът със симултанния превод, както и логото на телевизията, но за сметка на това си е добавил дървена банка на която краля на попа да се облегне. Ето референцията която му дадох, и която голям зор видях докато я генерирам. Искам да ви кажа, че когато вкарат законови мерки, тия картинки нямат шанс да минат. Каквото и да говорите на модела, той много добре разбира кой стои на снимката.
Seedance 2.0. След голяма борба, само този модел успя да се справи. Оригиналното видео има два последователни кадъра, нарочно избрах такъв сегмент, в който се сменя сцената. В първия що годе успя, но втория си го измисли, като липсват персонажите от оригиналното видео. Поне пропорция и позата е спазена.
Kling 3.0 Motion Control. Забележете как логото на телевизията е изчезнало, и че фигурата на Тръмп не е в същата пропорция. Ето кадъра който му подадох:
Тук модела е Seedance 2.0 и смятам че се е справил супер. Ето снимката която му подадох:
За краткия период на съществуване на тази технология, това е направо феноменално според мен. Даже не мога да си представя докъде ще стигнат нещата след година-две. Да не говорим, че тук става дума за масови модели, евтини и достъпни за всички. Представете си с какво боравят в Холивуд.
Коментари
Публикуване на коментар