Пропускане към основното съдържание

Тествах AI Video Replacement в Higgsfield

 След като миналата седмица си поиграх с новия Higgsfield Plugin за DaVinci Resolve, реших че е време да видя докъде са стигнали моделите с функцията Replace. 


Идеята е проста. Избирате си някакво истинско видео, може да е нещо снимано от вас, или каквото ви е на сърце, и казвате на модела да смени определен човек в него с друг персонаж, който вие му подавате. Не говорим за Face Swap, в който заменяте лицето на даден персонаж, а да замените цяла фигура с друга, като запазите цялото изпълнение – движения, жестове, мимики, начина на говорене, поведение пред камерата.

За тестовете използвах няколко различни видеа и различни персонажи. Не съм търсил политическа провокация, сензация или някакво скандално съдържание. Просто се насочих към разпознаваеми лица, защото когато всички знаем как изглежда даден човек, гледали сме го многократно, то тогава по-лесно можем да преценим дали моделът се е справил добре. Това е причината, не търсете под вола теле. Също така, гледах оригиналите да бъдат разнообразни, да има жестове, пеене, движение, говор... 

Използвах три модела - Seedance 2.0, Kling 3.0 Motion Control и Wan 2.2 Animate.

За генериране на заместващи персонажи ползвах основно Nano Banana 2. Пробвах няколко различни варианти за генериране на кадри от ChatGPT Image Generation, обаче всеки път ме отрязваше с рестрикции за авторски права, за сензитивни кадри и прочие и накрая се отказах. 

Същия проблем имах и когато генерирах видеата. Като цяло, най-силно ограничение даде най-силния модел, а именно Seedance 2.0. Това, което не мина при него, често минаваше при останалите два модела. Това обаче означава само, че рестрикциите са били преодолени, а не че крайният резултат непременно е бил добър. Тук оставям само сполучливите експерименти, като държа да отбележа, че несполучливите бяха доста много. Някои от тях бяха толкоз счупени, че съм се превивал от смях. Може би трябва да ги събирам и някой ден да направя клип от тях. Някакъв кратък хорър филм например. 

Виждал съм в нета доста сполучливи неща, като вероятно причината на мен да не ми се получи чак толкова добре се крие в моята експертиза, в достъпването на моделите не директно, а през трета страна, в неправилни промптове и прочие. Специално за тези видеа, промптовете са ми били елементарни, замени човек Х, с човек от картинката която ти давам, като запазиш всичко в оригиналното видео. Единствено за Wan 2.2 Animate не съм писал промптове, защото модела така е зададен, че той върши само тази задача и му е ясно. За сметка на това, нито едно от видеата генерирани от този модел не можа да се класира за да го покажа.

Та, стига съм плямпал, ето ги четирите видеа.

Модел - Kling 3.0 Motion Control. Забележете как е спазил мимиките от лицето на Радев, повдигане на вежди, уста... Ллипсва прозорецът със симултанния превод, както и логото на телевизията, но за сметка на това си е добавил дървена банка на която краля на попа да се облегне. Ето референцията която му дадох, и която голям зор видях докато я генерирам. Искам да ви кажа, че когато вкарат законови мерки, тия картинки нямат шанс да минат. Каквото и да говорите на модела, той много добре разбира кой стои на снимката.



Seedance 2.0. След голяма борба, само този модел успя да се справи. Оригиналното видео има два последователни кадъра, нарочно избрах такъв сегмент, в който се сменя сцената. В първия що годе успя, но втория си го измисли, като липсват персонажите от оригиналното видео. Поне пропорция и позата е спазена. 

Kling 3.0 Motion Control. Забележете как логото на телевизията е изчезнало, и че фигурата на Тръмп не е в същата пропорция. Ето кадъра който му подадох:


Тук модела е Seedance 2.0 и смятам че се е справил супер. Ето снимката която му подадох:


За краткия период на съществуване на тази технология, това е направо феноменално според мен. Даже не мога да си представя докъде ще стигнат нещата след година-две. Да не говорим, че тук става дума за масови модели, евтини и достъпни за всички. Представете си с какво боравят в Холивуд.

Коментари

Популярни публикации от този блог

World in My Eyes

 „World in My Eyes“ е опит за късометражен филм, създаден с помощта на AI-генерирани изображения, видео модели + класически монтаж. Историята тръгна от една моя идея, а разкадровката и визуалната структура бяха разработени с помощта на ChatGPT, който изгради последователността на сцените и всички промптове към AI моделите. Статичните ключови кадри бяха генерирани чрез Nano Banana Pro, които впоследствие бяха използвани за създаване на визуалната база на всяка сцена. Видеопрeходите между сцените бяха реализирани основно с Google Veo 3.1, който се справи блестящо с  по-голямата част от движението, трансформациите и движения на камерата. За два специфични кадъра, които Veo отказа поради ограничения в модела, използвах Kling 2.1 Master, който се справи отлично, макар че неговата сила е друга и не поддържа онези преходи които бях набелязал предварително. Визуално, филмът е осъществен изцяло в Higgsfield . Генерирал съм няколко сцени повторно, заради незадоволителен резултат, като о...

От Маркс до изкуствения интелект: не трудът, а посоката е истинският проблем

Карл Маркс изгражда своята теория върху убеждението, че трудът е източникът на стойността. В Das Kapital и особено в Grundrisse той твърди, че стойността на всяка стока произтича от човешкия труд. Оттук и неговият въпрос: Какво става, когато трудът престане да е мярка на стойността? За Маркс това е фундаментална криза на капитализма. Ако трудът е изместен от машините, системата се руши отвътре. Но проблемът с изкуствения интелект може да е още по-дълбок от този, който Маркс е предвиждал. Истинската заплаха може би не е в липсата на труд, а в загубата на посока. Дарвиновата теория ни показва, че оцеляването на видовете зависи от тяхната способност да се адаптират. Човекът никога не е бил най-силният или най-бързият вид, но именно чрез умението да мисли, да изобретява и да насочва развитието той се превръща в господар на планетата. Адаптивност. От първобитния огън и колелото, през печатната машина и двигателя с вътрешно горене, до компютъра и ракетата – всички тези иновации са доказателс...

Try Walking in My Mind

  Всичко започна от една снимка, която бях направил на сина ми преди много години, когато все още беше дете. Ето я и нея: Спомням си много добре този момент, но сега, с помощта на изкуствения интелект си помислих, че мога да развия от него цяла история. Тръгнах без ясна цел. Знаех само, че искам да направя филмче, в което няма отделни сцени, а кадъра върви от началото до края в една последователност. После реших, че тъй като вече имаме  вода в кадър, мога да премина през четирите основни елемента от древногръцката философия – вода, земя, огън и въздух. В края добавих нещо от мен, защото историята ми се струваше незавършена... Ако ви е интересна темата с аудиовизуалното съдържание през призмата на изкуствения интелект, горещо препоръчвам да следите канала Bob Doyle Media . Иначе, конкретно за филмчето съм ползвал изцяло свободни ресурси. Ограничението е, че кредитите които имате на ежедневна база не стигат за подобен тип проект, та около 10 дни ми отне да го направя, но пък е б...