Videoerstellung

  • Die eigene KI auf deinem Rechner zu Hause – kann das echt funktionieren?..

    Hidiho liebe Community! Heute wird es nicht nur technisch – es wird Multimedialsuperdupertechnisch! Es geht diesmal nämlich um die Frage, ob es möglich ist, eine KI zu Hause auf dem Rechner zu installieren und natürlich noch wichtiger: damit zu arbeiten. Und zwar nicht nur als Unterstützer im Office-Bereich, sondern auch bei kreativen Aufgaben, wie Bild, Video und sogar Musik-Erstellung.

    Die eigene KI, mit der Du dich unterhalten kannst, die darüber hinaus Bilder, Videos und Mukke erstellen kann? Das hört sich doch spannend an, oder? Und als nächstes kommt dann die Frage, ob man damit wirklich zuverlässig arbeiten kann. Ich habe es für euch ausprobiert. Das Ergebnis wird aber hier nicht gespoilert – da müsst ihr schon den ganzen Beitrag lesen.. Bereit? Dann legen wir los!

    Global Player wollen dass du deren kostenpflichtige KIs nutzt..

    Die Firmen, die dir KI-Modelle als neuen heißen Scheiss aufschwatzen wollen. machen das natürlich nicht, weil sie Menschenfreunde sind – Leute! Wir leben im Kapitalismus und Amerika ist das Mutterland des Turbo-Kapitalismus! Es geht darum Geld zu verdienen! VIEL GELD!! Du kannst dann bei den meisten Firmen deren Modelle im monatlichen Abo nutzen. Ja, es gibt auch kostenlose Varianten – doch die sind halt in der Regel stark limitiert – ist also so, als würdest Du dir einen Ferrari Enzo ausleihen aber die Karre ist auf maximal 50 Km/h gedrosselt damit Du damit keinen Blödsinn machst.

    Die eigene KI(Bild links: Bei der Software LM-Studio hast Du die Qual der Wahl, welches der zahlreichen Large Language Modelle du nutzen möchtest. Beachte, dass da aber auch gehörig Festplattenspeicher verbraten wird, denn die ganzen Daten-Bibliotheken sind häufig bis knapp 20 Gigabyte gross. Da sollte man schon etwas selektieren, was man herunterlädt.)

    Bei ChatGPT kostet ein Abo zwischen 21,00 $ und 105,00 $ für Privatpersonen. Bei Claude von Athropic sind die Preise ähnlich: 15,00 € bis 90,00 € je nachdem ob man das Pro oder Max-Abo wählt. Bei google Gemini wirst Du dann vergleichsweise günstige 4,99 bis 22,00 € im Monat los.

    Klar, haben diese Firmen Kosten und deren Rechenzentren sind Energieverschwender ohne Ende. Dass diese Kosten wieder reingeholt werden müssen ist logisch. Aber wenn man sieht wieviel KI-Mist mittlerweile auf YouTube und in den sozialen Medien auftaucht, wünscht man sich dass die Plattformen härter gegen KI-Inhalte vorgehen würden. Auf Instagram ist gefühlt jeder 2. Post von einer KI oder KI generierter Inhalt. Dieser ganze Null-Inhalt Content vermüllt dein Gehirn und lenkt dich von wirklich wichtigen Dingen ab (vergleiche dazu mein Interview mit einer KI und dem Begriff der „Aufmerksamkeit als wertvolles Gut“).

    Der Gegner der Global KI-Player: „offene“ KI-Modelle..

    Quasi als Gegenpool zu den kostenpflichtigen Modelle aus den USA gibt es KI Modelle, die nicht nur kostenlos sind, sondern auch echt leistungsfähig und zum größten Teil sogar auf deinem Rechner installierbar und lauffähig sind:

    • Llama von Meta: Eines der bekanntesten offenen Sprachmodelle (aktuell in fortschrittlichen Versionen), das sich flexibel anpassen lässt.
    • DeepSeek (wie DeepSeek-R1): Gilt als echte Leistungs-Überraschung aus China, der bei vielen Aufgaben extrem starke Ergebnisse liefert und den Markt momentan aufmischt.
    • Qwen von Alibaba: Qwen ist ein starkes, vielseitiges Sprachmodell mit exzellenten Fähigkeiten in vielen Sprachen und Programmieraufgaben.
    • Mistral von Mistral AI: Leistungsstarke Modelle aus Europa (wie die Medium-Reihe oder offene Spracherkennung wie Voxtral), die Datenschutzkonform lokal betrieben werden können.
    • Gemma von Google: Leichtere, offene Modelle von Google, die sich gut für kleinere Hardware oder spezifische Aufgaben eignen.
    • dazu gibt es noch weitere Modelle wie Muse Glimmer, Bonsai, Nemotron, LFM2, GLM Flash, und, und, und..

    Viele Modelle sind quasi 1:1 Klone namhafter großer Large language Modelle.

    Wer sich mit dem Gedanken anfreunden kann eine KI auf seinem Rechner zu nutzen, die auch Offline immer zur Verfügung steht, der hat also durchaus eine ganz hübsche Auswahl. Beachte aber bitte die Größe der einzelnen Modelle, sonst ist deine Festplatte schnell voll..

    Der Traum von der eigenen KI – endlich machbar!

    Wer sich auch mal als Herr über die KI fühlen will: es benötigt zumindest zwei unterschiedlich Software-Lösungen um die die für Texte und programmiertechnische Aufgaben spezialisierten LLMs (Lage language Modelle) und die für grafischen Output entwickelten Container ans laufen zu bringen. Wichtig dabei: Es handelt sich beide Male um kostenlose Software.

    Im Bereich der Programmierung und Kommunikation ist in meinen Augen das LM-Studio erste Wahl – im Bereich der Multimedia-Dateien (Bild, Video, 3D Modelle und Musik), ist Comfy für mich das beste Programm um coolen Output zu erzeugen.

    Die eigene KI(Bild rechts: Auch dieses Bild entstand direkt im Rechner: der Prompt war ungefähr: ein älterer Mann sitzt in einer Büro-Umgebung vor einem aufgeklappten Laptop auf dessen Display ein Roboter-Kopf sichtbar ist, der mit ihm spricht.)

    Ich wiederhole es zur Sicherheit nochmal: Die Benutzung der Software ist KOSTENLOS! Kein Abo, keine Kosten für Token (die Währung mit der man die Rechenleistung der KI bezahlt), kein Datentransfer ins Nirgendwo! Alles wird ausschließlich auf der CPU und Grafikkarte deines eigenen Rechners berechnet.

    Kleiner Spielverderber-Hinweis: deine Hardware sollte schon potent genug sein. Mit einem 300 € No-Name Laptop von TEMU wirst du hier scheitern. Tatsächlich gilt hier: BIGGER IS BETTER! Glücklicherweise bin ich da ganz gut ausgestattet – rein Rechnertechnisch natürlich..


    HIER FOLGT EINE WERBEANZEIGE


    Von mir wurde für Qwen (Ausgabe von Text) mein HP Omnibook mit 32 GB RAM, dem Intel i7 Ultra Prozessor und einer auf dem Chip integrierten Grafikchip Intel® Arc™ mit 8 GB Speicher genutzt (Test hier). Dieses Convertible hat bereits durch den mit neuronalen Funktionen ausgestattetem Prozessor KI-Funktionen eingebaut und mit der „Recall“-Funktion ein Feature von Microsoft, dass andere Rechner nicht bekommen. Dort kam als Plattform das LM-Studio (Bionic) zum Einsatz

    Comfy? Was zum Teufel ist das?..

    Bei der Grafik war dafür mein etwas älteres HP ZBook Fury G9 die Maschine meiner Wahl, da die Intel i7 CPU mit 16 Kernen in Verbindung mit einer dedizierten hochwertigen RTX-Grafikkarte von NVIDIA mit 12 GB RAM, sehr performant ist und sowohl Bild als auch und Videobearbeitung schnell genug berechnete. Hier konnte ich aber mit dem LM-Studio nichts reißen, denn die dort ladbaren LLMs sind nicht für grafische Ausgaben gedacht.

    Dafür gibt es aber mit „COMFY“ eine Software-Plattform, die genau für diesen Fall gedacht ist: geile Multimedia-Dateien zu erstellen!

    Wie cool so ein Video aussehen kann? Guckst Du Hier:

    Sie sehen gerade einen Platzhalterinhalt von YouTube. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.

    Mehr Informationen

    (Video oben: Dieses Video ist komplett „geprompted“ – nur durch Texteingaben erstellt – worden. Ich schrieb wie das Umfeld aussehen sollte, welche Lichtstimmung erzeugt werden sollte, welche Szenen was darstellen sollten und wie viele Sekunden die dauern sollten – danach war die CPU und der GPU dran, das ganze Geschreibsel in bewegte Bilder umzusetzen. Selbst der Ton wurde passend dazu bei der Erstelllung des Videos generiert. Großes Kino? Jepp! Aber sowas von! Auch wenn das aufsetzen der Sonnenbrille kacke generiert ist – aber wofür kann man Videos schneiden..)

    Du bist platt? Ja, mit Recht! Diese fast 30 Sekunden lange Video-Sequenz mit Bild, Geräuschen und Ambient-Musik hat meine Hardware (HP ZBook Fury G9) auf der mobilen Workstation in knapp 4 Stunden generiert. 4 Stunden für ein Video ist nun wirklich nicht lang, wenn man überlegt, dass jeder einzelen Video-Frame (Bild) gerendert werden muss und das je nach Codec zwischen 24 und 60 mal pro Sekunde.

    Auf meinem Medien-Server mit identischer i7 CPU, 32 GB Ram aber einer NVIDIA RTX5060Ti mit 16 GB Ram dauerte die gleiche Szene nur anderthalb Stunden bis das Video komplett erstellt war. Die GPU der Grafikkarte war während der ganzen Zeit bei 92 – 100% Auslastung. Die Grafikkarte hat also direkten Einfluss auf die Dauer der Berechnung.

    Die eigene KI - Comfy User Interface(Bild links: Das UI (User Interface aka Benutzeroberfläche) von Comfy ist etwas komplexer, weil es Knotenbasiert arbeitet. Wer 3ds Max nutzt, der kennt diesen Aufbau vom Material-Editor her. Eigentlich ist dieser Aufbau aber logisch und praktisch. Vor allem bei der Fehlereingrenzung.)

    Bei dem ZBook sind das bei 26 Sekunden und 24 Frames insgesamt 624 Bilder in 4 Stunden. Das sind grade mal 23 Sekunden Renderzeit  pro Bild – echt beeindruckend! Wenn die Auflösung des Videso mit 848 x 481 (0,4 Megapixel) zwar jetzt nicht HD Qualität hat, kommt es selbst auf einem 27″ Monitor noch gut rüber.

    Das auf YouTube hochgeladene Beispiel-Video ist doch ein guter Beweis dafür, oder? Da der Medienserver mit der RTX5060Ti das in anderthalb Stunden stemmt ist ein Frame in knapp 7 Sekunden generiert – eine Zeit die ich in 3ds Max nimals hinbekommen würde. Und dazu müsste erst stundenlang eine Szene modelliert werden.

    Die maximale Auflösung eines Videos ist vom addressierbaren Speicher eurer Grafikkarte abhängig. Bei mir gab es bei 1280×736 Pixeln (0,9 Megapixeln) eine Fehlermeldung und ich musste die maximale Auflösung auf 960×544 Pixel (0,5 Megapixel) runterschrauben. Das ist aber immer noch sehr anschaubar und qualitativ in Top-Qualität.der Autor

     


    HIER FOLGT EINE WERBEANZEIGE


    Comfy? Wie funktioniert das?

    Wenn Du auch Bilder, Videos und Audio-Dateien erstellen willst (und ausreichend potente Hardware hast), dann geh auf diese Webseite und lade dir das knapp 600 Megabyte große Installationspaket herunter. Danach installierst Du es und konfigurierst wo das Arbeitsverzeichnis erstellt werden soll. Hier kann es sinnvoll sein auf eine zweite Festplatte oder Partition zu verweisen, denn die Bibliotheken der einzelnen Rendermodelle haben es in sich und so knapp 100 Gigabyte an Daten müssen später noch zusätzlich auf die Festplatte heruntergeladen werden. Diese Bibliotheken solltest Du am besten auf eine schnelle SSD packen.

    Die eigene KI auf deinem Rechner zu Hause - kann das echt funktionieren?..(Bild rechts: Comfy bringt mehr Möglichkeiten mit, als Du dir träumen lässt: Bilderstellung? Easy! Videos? Klar! 3D-Modelle? Sichi! Mukke? Wecke den DJ in Dir! Die normalen Modelle wie MiniMax und Wan reichen im Video-Bereich in der Regel völlig aus. Wer es noch besser haben will, der kann mit SeeDance ein kostenpflichtiges Modell nutzen.)

    Hast Du das gemacht fragt dich Comfy, was Du erstellen willst: ein Bild, ein Video, ein 3D Modell oder ein Lied – hier gibt es dann mehrere Modelle – darunter auch jeweils eines welches Kosten verursacht. Doch die kostenlosen Modelle sind völlig ausreichend um coolen Content zu generieren. Du willst ja sicher nicht sofort einen Abendfüllenden Action-Kracher produzieren, oder?

    die KI auf dem eigenen Rechner? Fazit..

    Die eigene KI auf deinem Rechner zu Hause - kann das echt funktionieren?..

    +

    • komplett autonom laufende KI ohne Internetdatenverkehr
    • komplett kostenlos
    • sehr leistungsfähige Modelle verfügbar
    • Software wird gut mit Updates versorgt
    • einfache Installation
    Die eigene KI auf deinem Rechner zu Hause - kann das echt funktionieren?..

    -

    • Hoher Speicherverbrauch auf den Festplatten
    • hochwertige Hardware Voraussetzung
    • Installation von Erweiterungen manchmal Tricky
    Der Traum der eigenen KI auf dem heimischen Rechner muss keiner bleiben. Statt Copilot und Dall-E sind Qwen und die Comfy Plattform KIs die nicht mit dem Internet quatschen, sondern lokal ihre Arbeit verrichten. Einen Wermutstropfen gibt es leider: deine Hardware muss schon etwas besser sein. Ein 'KI-Rechner' mit einer CPU die neuronale Funktionen und den entsprechen Grafikchip hat oder eine schnelle CPU mit hochwertiger Grafikkarte ist ein Muss.

    Hast Du dich entschieden, welches Modell du benutzen willst, startet eine Comfy-Instanz, überprüft deine Grafikkarte auf die nötige Power und dann geht die nächste Download-Arie los. Netterweise ist eine Beispieldatei bereits geöffnet – Du fängst also nicht direkt bei Null an, sondern kannst dich an den englischen Texten der Vorlage orientieren. Hier gilt: Wenn Du etwas nicht weißt, dann schreibe es lieber in Deutsch und lass es im google Übersetzer auf Englisch übersetzen. Und je genauer Du etwas beschreibst, umso näher an deiner Vorstellung ist das spätere Ergebnis.


    HIER FOLGT EINE WERBEANZEIGE


    Es kann auch Sinn machen einzelne Sequenzen ohne Ton zu prompten und die kürzeren Videos mit Shotcut oder einem anderen Schnittprogramm aneinander zu setzen, zu schneiden und nachzuvertonen. Grade bei längeren Sequenzen, die stundenlang brauchen, bis man das (manchmal beschissene) Ergebnis sieht, weil man sich beim Texten ungenau ausgedrückt hat oder die KI einen Bock reingebastelt hat, kann dass die Fertigstellung eines Clips stark verkürzen.

    In Shotcut kann man auch die Tonspur extrahieren – je nach Musik-Software kannst Du da also noch ordentlich Effekte und Filter aus der VST-Abteilung einbauen.

    Leider hat das Video einen ziemlich blöden Bug – was zeigt, dass die KI eben halt nicht perfekt ist. Wer ihn erkennt: schreibt ihn mir in die Kommentare..

    Und wer den prompt für das obige Video als Template haben will: hier ist die Text-Datei zum Download.

    Der Autor hat sich auf das Niveau einer KI herabgelassen um anderen Humanoiden zu zeigen, dass wir es immer noch viel besser drauf haben, als die KI. Also teilweise – vielleicht punktuell.. Ach Fuck! Nein, die KI kann alles das was was ein kreativer Kopf macht, auch – nur besser – und das auch noch in dem Zehntel der Zeit! Die kreativen Berufe sind verloren.. Sorry!

    der Autor

Schaltfläche "Zurück zum Anfang"