POJOKSATU.id - Di era digital yang terus berkembang, OpenAI telah mengambil langkah besar dengan meluncurkan Sora, sebuah model kecerdasan buatan yang mampu menghasilkan video dari teks.

Diperkenalkan pada Februari 2024, Sora telah menarik perhatian dunia dengan kemampuannya yang luar biasa.

Apa Itu Sora AI?

Sora adalah model AI generatif yang dapat membuat video berdurasi hingga satu menit dari instruksi teks.

Proyek ambisius dari OpenAI ini mewakili terobosan dalam generasi video berbasis AI. Menggunakan arsitektur transformer yang serupa dengan model GPT dan teknik recaptioning dari DALL-E 3.

Sora memberikan sebuah terobosan dalam bidang generasi video, karena bisa membuat video berdurasi hingga satu menit hanya dari instruksi teks.

Bagaimana Sora Bekerja?

Sora beroperasi dengan prinsip yang serupa dengan DALL-E 3 dan Midjourney, mengubah instruksi teks menjadi konten visual berupa gambar.

Pada dasarnya, video adalah serangkaian gambar yang ditampilkan secara berurutan dengan kecepatan tinggi, menciptakan ilusi gerakan.

Halus tidaknya sebuah video ditentukan dari banyaknya gambar pada setiap detik. Oleh sebab itu munculah istilah FPS (Frame Per Second), misalnya 30 FPS, 60 FPS, dan lain sebagainya.

Artinya, jika sebuah video mempunyai FPS 30 maka dalam setiap detik terdapat 30 rangkaian gambar yang menghasilkan gerakan, semakin tinggi FPS akan semakin bagus.

Jadi video adalah hasil gambar yang ditumpuk sedemikian banyak sehingga menghasilkan sebuah video.

Anda bisa menemukan berbagai daftar prompt atau format perintah yang bisa digunakan untuk menghasilkan gambar menakjubkan, misalnya midjourney prompts oleh Raja Tips.

Dengan pengetahuan prompt yang matang untuk generative images, memungkinkan Anda untuk lebih mahir saat membuat video dengan Sora AI.

Sedangkan Sora, telah mempunyai basis teknologi yang sudah cukup matang dengan generative imagenya, DALLE.

Sehingga dengan memanfaatkan kapabilitas transformer dan model diffusion, Sora dapat menginterpretasi instruksi teks dan mengubahnya menjadi video yang kaya detail dan visual yang menakjubkan.

Arsitektur dan Inovasi Sora

Sora menggunakan model difusi teks-kondisional yang dilatih bersama-sama pada video dan gambar dengan durasi, resolusi, dan rasio aspek variabel.

Ini memanfaatkan arsitektur transformer pada patch spacetime dari kode laten video dan gambar.

Sora telah dilatih untuk memprediksi "patch bersih" dari patch berisik yang diberi input, bersama dengan informasi kondisional seperti teks.

Ini memungkinkan Sora untuk menghasilkan video berkualitas tinggi yang sesuai dengan prompt pengguna.

[Video 1] > Link

Kemampuan dan Aplikasi

Sora tidak hanya menghasilkan video realistis, tetapi juga video imajinatif dengan berbagai rasio aspek.

Mengambil inspirasi dari model bahasa besar, Sora menggunakan patch visual sebagai token, memungkinkan pelatihan efisien pada berbagai jenis video dan gambar.

Proses ini melibatkan kompresi video ke ruang laten berdimensi lebih rendah, diikuti dengan dekomposisi representasi ke dalam patch spacetime.

Keunggulan ini membuka banyak kemungkinan aplikasi, mulai dari edukasi hingga hiburan. Sora juga dapat membantu orang dengan disabilitas untuk lebih memahami konten video.

[Video 2] > Link

Potensi, Risiko dan Tantangan

Meskipun Sora memiliki potensi yang besar, terdapat juga risiko yang harus diperhatikan, seperti penggunaannya untuk menyebarkan informasi yang salah atau membuat video yang menyinggung.

Oleh karena itu, OpenAI mengambil langkah berhati-hati dalam peluncurannya, dengan melibatkan para ahli untuk menguji dan mengevaluasi potensi penyalahgunaannya.

Pengembangan Sora menimbulkan pertanyaan penting seputar etika dan dampak sosial. Meskipun menawarkan kemajuan teknologi, Sora juga memicu diskusi tentang masa depan AI dalam masyarakat kita, khususnya terkait disinformasi dan dampaknya pada industri kreatif.

Penutup dan Kesimpulan

Kunci dari kecanggihan Sora terletak pada cara ia memproses dan memahami teks. Dengan memanfaatkan kapabilitas transformer dan model diffusion, Sora dapat menginterpretasi instruksi teks dan mengubahnya menjadi video yang kaya detail dan visual yang menakjubkan.

Namun Sora membawa implikasi sosial dan etika yang signifikan. Dari satu sisi, teknologi ini menawarkan kemungkinan baru dalam kreativitas dan produksi media.

Namun, di sisi lain, ada kekhawatiran terkait penyebaran disinformasi dan dampaknya terhadap industri kreatif.

Keamanan dan kebenaran konten tetap menjadi masalah yang sedang berlangsung dan membutuhkan pemahaman dari masyarakat serta adaptasi dari jaringan media sosial.

Sora oleh OpenAI menandai era baru dalam generasi video AI. Dengan potensi yang luas untuk berbagai aplikasi, Sora tidak hanya mendorong batas-batas kemungkinan teknis tetapi juga menghadirkan tantangan dan pertanyaan penting seputar etika dan dampak sosial. ***