Το νέο μοντέλο Τεχνητής Νοημοσύνης της Google που μετατρέπει τα πάντα σε οτιδήποτε είναι εντυπωσιακό

Google

Η Omni, η νέα οικογένεια παραγωγικών μοντέλων της Google, υπόσχεται να μετατρέπει στο μέλλον οποιαδήποτε μορφή εισαγωγής δεδομένων (φωτογραφία, βίντεο, κείμενο) σε οποιοδήποτε άλλο είδος αρχείου.

Στην παρούσα φάση, η τεχνολογία αυτή κάνει τα πρώτα της βήματα εστιάζοντας στη δημιουργία βίντεο μέσω του μοντέλου Omni Flash, το οποίο είναι διαθέσιμο στην πλατφόρμα επεξεργασίας βίντεο Flow της Google, αντικαθιστώντας και βελτιώνοντας το προηγούμενο μοντέλο, Veo.

Google: Βελτιώσεις στη διατήρηση χαρακτήρων και στην επεξεργασία

Το Omni Flash επιτρέπει στους χρήστες να ανεβάσουν ένα βίντεο και, σε συνδυασμό με μια γραπτή εντολή (text prompt), να δημιουργήσουν ένα νέο αποτέλεσμα. Το μοντέλο ενσωματώνει περισσότερες γνώσεις για τον πραγματικό κόσμο και παρουσιάζει μεγαλύτερη συνέπεια στη διατήρηση των χαρακτηριστικών ενός ήρωα σε όλη τη διάρκεια του κλιπ, σε σχέση με προκάτοχούς του.

Ωστόσο, οι δοκιμές δείχνουν ότι η τεχνολογία εξακολουθεί να παρουσιάζει αστάθειες. Σε βίντεο με κινούμενα σχέδια ή λούτρινα παιχνίδια, αντικείμενα που κρατούν οι χαρακτήρες αλλάζουν μορφή από σκηνή σε σκηνή (π.χ. ένα βάζο με μέλι μετατρέπεται σε πλαστικό μπουκάλι), ενώ παρατηρούνται και απότομες αλλαγές στον προσανατολισμό των σωμάτων.

Η επεξεργασία μέσω γραπτών εντολών λειτουργεί καλύτερα σε σχέση με το παρελθόν, αλλά δεν αποφεύγει τα λάθη: η προσπάθεια αφαίρεσης ενός ανεπιθύμητου στοιχείου από μια σκηνή μπορεί να οδηγήσει στην προσθήκη του σε όλες τις υπόλοιπες.

Το υψηλό κόστος των credits

Η χρήση του Omni Flash βασίζεται σε ένα σύστημα πόντων (credits). Η δημιουργία ενός βίντεο κοστίζει από 15 έως 40 credits ανάλογα με τη διάρκεια και τα αρχεία εισαγωγής, ενώ κάθε γύρος διορθώσεων και επεξεργασίας χρεώνεται σταθερά με 40 credits.

Στο συνδρομητικό πρόγραμμα AI Pro (αξίας 20 δολαρίων τον μήνα), το οποίο παρέχει 1.000 credits μηνιαίως, η παραγωγή περίπου 20 σύντομων κλιπ με μερικές διορθώσεις μπορεί να καταναλώσει σχεδόν το σύνολο του διαθέσιμου ορίου. Αυτό σημαίνει ότι η αναζήτηση του ιδανικού αποτελέσματος μέσω συνεχών δοκιμών παραμένει μια ακριβή διαδικασία.

Η πρόκληση των Deepfakes και η «απόκοσμη κοιλάδα»

Η μεγαλύτερη αναβάθμιση του Omni εντοπίζεται στην ικανότητά του να προσθέτει στοιχεία που έχουν δημιουργηθεί από AI σε πραγματικά βίντεο. Δοκιμές που πραγματοποιήθηκαν με τη χρήση ενός απλού βίντεο-σέλφι έδειξαν ότι το μοντέλο μπορεί να τοποθετήσει τον χρήστη σε εντελώς διαφορετικά περιβάλλοντα (όπως μπροστά από τον Πύργο του Άιφελ ή μέσα σε ένα αεροπλάνο) να εκτελεί πειστικές κινήσεις, όπως το να τρώει.

Αν και υπάρχουν μικρές λεπτομέρειες που προδίδουν την ψηφιακή επεξεργασία -όπως ένας ελαφρώς τεχνητός ήχος ή δευτερεύοντες χαρακτήρες που εμφανίζονται διπλά στο φόντο- το τελικό αποτέλεσμα είναι αρκετά ρεαλιστικό ώστε να ξεγελάσει έναν παρατηρητή στα μέσα κοινωνικής δικτύωσης.

Η ευκολία με την οποία μπορεί πλέον κανείς να δημιουργήσει πειστικά deepfakes με ελάχιστη προσπάθεια επιβεβαιώνει ότι η τεχνολογία έχει εισέλθει βαθιά στην «απόκοσμη κοιλάδα» (uncanny valley), όπου η διάκριση μεταξύ πραγματικού και τεχνητού γίνεται όλο και πιο δύσκολη.

Scroll to Top