Notebookcheck Logo

ComfyUI z MiniMax H3: Czy jest lepszy od Kling AI, Seedance i innych generatorów wideo w wersji bezpłatnej?

ⓘ AI-generated, MiniMax H3
Korzystanie z generatorów wideo opartych na sztucznej inteligencji w wersji bezpłatnej jest znacznie trudniejsze niż w przypadku typowych modeli językowych (LLM), takich jak ChatGPT, a większość dostawców bardzo skąpo przyznaje bezpłatne kredyty. Jeszcze trudniejsze jest skłonienie ich do stworzenia dokładnie tego, czego Państwo oczekują — przy jednoczesnym zachowaniu dobrego, spójnego wyglądu. Postanowiłem zatem przetestować alternatywę: uruchomienie lokalnego modelu, takiego jak MiniMax H3.
AI

Korzystanie z generatorów wideo opartych na sztucznej inteligencji w wersji bezpłatnej jest znacznie trudniejsze niż w przypadku typowych modeli językowych (LLM), takich jak ChatGPT, a większość dostawców skąpo przyznaje darmowe kredyty. Jeszcze trudniejsze jest skłonienie ich do stworzenia dokładnie tego, czego Pan/Pani oczekuje — przy jednoczesnym zachowaniu dobrego, spójnego wyglądu. Postanowiłem więc przetestować alternatywę: uruchomienie lokalnego modelu, takiego jak MiniMax H3.

Mój syn chce wykorzystać sztuczną inteligencję do stworzenia własnego, cóż, filmu o budowaniu z klocków na temat mieczy świetlnych. Obecnie fascynuje go ten temat. Ponieważ jednak nie chciałem od razu wydawać dużych pieniędzy na kosztowną subskrypcję usługi generującej filmy opartej na sztucznej inteligencji na potrzeby jego eksperymentów, początkowo próbował korzystać z Kling AI i podobnych usług za darmo.

Większość generatorów filmów opartych na sztucznej inteligencji przyciąga użytkowników darmowym limitem na początek, aby skłonić ich do założenia konta. Jednak haczyk szybko staje się oczywisty: jeśli chcą Państwo na stałe tworzyć więcej niż jeden lub dwa trzysekundowe filmy dziennie, szybko zostają Państwo skłonieni do wykupienia kosztownej subskrypcji.

Jednak nawet pod względem wizualnym filmy utworzone do tego momentu nie były szczególnie satysfakcjonujące. Zachowanie spójności otoczenia, obiektów i postaci jest zazwyczaj trudne. Rozczarowany chłopiec skłonił mnie do wypróbowania lokalnego rozwiązania.

Lokalne modele i rozwiązania wymagają oczywiście wydajnego sprzętu. Test przeprowadzamy na komputerze Razer Blade 16 (2025) wyposażonym w kartę graficzną RTX 5090 i 24 GB pamięci VRAM. Ogólnie rzecz biorąc, generowanie filmów staje się naprawdę interesujące dopiero przy 8 GB pamięci VRAM, a w tym przypadku większa pojemność faktycznie przekłada się na lepsze wyniki.

Dostępnych jest wiele interfejsów dla tego modelu — zdecydowaliśmy się na MiniMax H3. Można go uruchomić na przykład w Ollama, a także w Pinokio lub Stability Matrix. Ten ostatni zawiera również ComfyUI, graficzny interfejs do obsługi procesów opartych na sztucznej inteligencji, który nie ogranicza się wyłącznie do generowania filmów. Napotkałem jednak problemy z tą kombinacją, dlatego zdecydowałem się na samodzielną wersję ComfyUI (ComfyUI.org), którą można pobrać jako aplikację dla systemu Windows i innych platform.

Comfy Desktop
ⓘ Screenshot
Comfy Desktop

ComfyUI wymaga od początkujących pewnego czasu na przyzwyczajenie się, ale otwiera ogromne możliwości w zakresie generowania filmów. Tworzy się przepływy pracy z poszczególnych węzłów, co w istocie stanowi modułowy zestaw narzędzi złożony z wielu narzędzi/węzłów. Każdy węzeł posiada wejście i wyjście oraz może być połączony z innymi węzłami.

Każdy węzeł reprezentuje narzędzie lub etap procesu i posiada dane wejściowe oraz dane wyjściowe
ⓘ AI-generated, ChatGPT
Każdy węzeł reprezentuje narzędzie lub etap procesu i posiada dane wejściowe oraz dane wyjściowe

Wszystkie narzędzia są podzielone na poszczególne węzły. Na przykład istnieje węzeł przeznaczony dla podpowiedzi tekstowej, wiele węzłów obrazowych, które mogą służyć jako punkty odniesienia lub etapy pośrednie przed wygenerowaniem wideo, a także inne narzędzia. Teoretycznie do każdego węzła można załadować oddzielny model sztucznej inteligencji — model LLM dla podpowiedzi tekstowej, model generujący obrazy dla węzłów obrazowych i tak dalej. Modele sztucznej inteligencji naturalnie zajmują dużo miejsca na dysku. Ostatecznie wszystkie węzły są przekazywane do węzła generującego wideo, który wytwarza wynik końcowy.

Początkowo eksperymentowaliśmy z ustawieniami wstępnymi typu „tekst na wideo”, ale wkrótce skupiliśmy się bardziej na opcji „materiał referencyjny na wideo”.

Najprostszy przypadek, konwersja tekstu na wideo: jeden węzeł służący do wyboru rozdzielczości, następnie główny węzeł z algorytmem sztucznej inteligencji do generowania wideo, a na końcu wyjście wideo, w tym format
ⓘ Screenshot Comfy Desktop Screenshot
Najprostszy przypadek, konwersja tekstu na wideo: jeden węzeł służący do wyboru rozdzielczości, następnie główny węzeł z algorytmem sztucznej inteligencji do generowania wideo, a na końcu wyjście wideo, w tym format

Szczególną zaletą tego rozwiązania jest to, że umożliwia ono również zachowanie spójności środowisk, obiektów i postaci. Na przykład w naszym pierwszym filmie stworzyliśmy zbudowany z klocków pancernik przelatujący przez kadr. W rozdzielczości 480p wygenerowanie go zajęło około 5,5 minuty, choć przy odpowiednim sprzęcie możliwe są wyższe rozdzielczości. W jednej z nadchodzących scen chcieliśmy jednak ponownie wykorzystać dokładnie ten sam pancernik. Wykonaliśmy więc zrzuty ekranu przedstawiające widok statku kosmicznego z przodu i z tyłu, zaimportowaliśmy te obrazy, połączyliśmy je jako odniesienia o nazwach Ship_front i Ship_rear z głównym węzłem, a następnie poinstruowaliśmy sztuczną inteligencję, aby wykorzystała właśnie ten statek w innej scenie. W przeciwnym razie sztuczna inteligencja wygenerowałaby nowy wygląd.

Nasz obraz referencyjny SHIP-001 przedstawiający statek zbudowany z klocków – zrzut ekranu z naszego pierwszego filmu
Nasz obraz referencyjny SHIP-001 przedstawiający statek zbudowany z klocków – zrzut ekranu z naszego pierwszego filmu
Na wszelki wypadek prosimy również o dołączenie zdjęcia referencyjnego SHIP-001_rear przedstawiającego widok z tyłu
Na wszelki wypadek prosimy również o dołączenie zdjęcia referencyjnego SHIP-001_rear przedstawiającego widok z tyłu
Nasz czarny charakter
Nasz czarny charakter
Most kapitański
Most kapitański

Po krótkim czasie zapoznania się z systemem i przy pomocy profesora YouTube’a szybko opracowaliśmy pierwszy schemat pracy nad naszymi scenami wideo i wygenerowaliśmy filmy, z których obaj byliśmy bardzo zadowoleni. Model językowy LLM — w tym przypadku ChatGPT — pomógł nam dostosować polecenia tekstowe specjalnie do MiniMax H3, dzięki czemu były one precyzyjne i szczegółowe.

Mój schemat pracy: W ChatGPT opisałem wygląd, jaki miałem na myśli, zaznaczyłem, że pewne nazwy marek nie powinny się pojawiać, choć sam wygląd mógłby być nimi inspirowany, wyjaśniłem, że powinien mieć kinowy charakter, oraz wskazałem, które elementy odniesienia (takie jak Ship_front) należy uwzględnić. Dopiero wtedy opisałem samą scenę. Wkleiłem polecenie dostosowane przez ChatGPT do węzła tekstowego w ComfyUI, w razie potrzeby dodałem zdjęcia referencyjne i gotowe.

ChatGPT stworzył tę instrukcję na podstawie przekazanych przez nas informacji
ⓘ Screenshot ChatGPT
ChatGPT stworzył tę instrukcję na podstawie przekazanych przez nas informacji

Można również poprosić ChatGPT o wygenerowanie uniwersalnego polecenia opartego na pożądanym wyglądzie i innych parametrach, które można zapisać na później. Jeśli ponownie wprowadzi się to polecenie do modelu LLM, będzie on dysponował wszystkimi niezbędnymi informacjami i będzie można od razu opisać kolejną scenę.

W każdym razie zarówno mój syn, jak i ja byliśmy znacznie bardziej zadowoleni z wyników niż w przypadku bezpłatnych wersji Kling AI, Seedance i podobnych usług. Liczne dostępne opcje zachęcają również do eksperymentowania, a użytkownik jest wreszcie wolny od irytujących limitów kredytów, monitów o subskrypcję, reklam oraz obaw związanych z bezpieczeństwem danych. Rozdzielczość nadal stanowi jednak problem. Rozdzielczość Full HD lub wyższa nie jest nawet dostępna jako opcja, prawdopodobnie dlatego, że wymagania sprzętowe byłyby zbyt wysokie. Przyszłe modele prawdopodobnie będą bardziej wydajne pod tym względem. Na razie można również rozszerzyć swój proces pracy za pomocą narzędzi do skalowania w górę.

Każdy, kto dysponuje niezbędnym sprzętem i interesuje się tworzeniem filmów, powinien zapoznać się z ComfyUI oraz dobrym lokalnym modelem sztucznej inteligencji. W szczególności ComfyUI umożliwia tworzenie niezwykle złożonych, wielowarstwowych procesów pracy — o ile faktycznie są one Państwu potrzebne. Jednak na początek niezbędne funkcje są już dostępne i można się ich szybko nauczyć.

Google LogoAdd as a preferred source on Google
Mail Logo
> laptopy testy i recenzje notebooki > Nowinki > Archiwum v2 > Archiwum 2026 08 > ComfyUI z MiniMax H3: Czy jest lepszy od Kling AI, Seedance i innych generatorów wideo w wersji bezpłatnej?
Christian Hintze, 2026-08-26 (Update: 2026-08-26)