1.35 juta persona Malaysia untuk menguji AI: apa yang diumumkan, dan apa yang belum muncul
YTL AI Labs dan NVIDIA mengumumkan Nemotron-Personas-Malaysia, dataset terbuka dengan 1.35 juta persona sintetik yang dijana daripada statistik rasmi negara. Dataset lain dalam siri yang sama ada dalam katalog awam NVIDIA, dataset Malaysia belum muncul di sana.
Pada 23 September 2026, YTL AI Labs Sdn Bhd mengumumkan satu dataset terbuka bernama Nemotron-Personas-Malaysia. Ia mengandungi 1.35 juta persona sintetik, iaitu orang yang tidak wujud, dicipta untuk mewakili kepelbagaian penduduk Malaysia. Kerja itu dilakukan bersama NVIDIA.
YTL AI Labs ialah anak syarikat YTL Power International Bhd. Dataset itu disediakan secara percuma untuk kegunaan komersial di bawah lesen Creative Commons Attribution 4.0 (CC-BY-4.0), dan mengikut kenyataan syarikat itu, tiada data peribadi digunakan dan tiada individu boleh dikenal pasti daripada persona tersebut.
Bagaimana 1.35 juta orang yang tidak wujud itu dibina
Angka 1.35 juta itu bukan dikarang. Ia dijana daripada 150,000 rekod asas yang datang daripada statistik rasmi, termasuk Jabatan Perangkaan Malaysia, OpenDOSM, MyCensus, eStatistik dan penerbitan tenaga kerja negara.
Setiap persona ialah orang hipotetikal yang dijana menggunakan jadual kebarangkalian berdasarkan statistik itu. Maknanya, sifat setiap persona diundi daripada taburan sebenar penduduk, bukan ditulis oleh seseorang. Setiap persona mengandungi 39 medan data.
- Ciri demografi seperti umur, jantina, etnik, pekerjaan dan kawasan kediaman.
- Sifat keperibadian berdasarkan model psikologi OCEAN, yang juga dikenali sebagai model Lima Faktor.
- Kumpulan etnik utama di Malaysia termasuk Melayu, Cina, India, Kadazan-Dusun, Bajau, Murut, Iban, Bidayuh dan Melanau.
- Pelbagai agama, pekerjaan dan latar belakang wilayah.
Menurut YTL AI Labs, ini dataset pertama dalam siri Nemotron-Personas NVIDIA yang menjadikan Bahasa Melayu sebagai bahasa utama. Siri yang sama sudah mempunyai dataset untuk Amerika Syarikat, Jepun, India, Singapura, Brazil, Perancis, Korea Selatan, El Salvador, Vietnam dan Belgium.
Kenapa buat orang palsu untuk menguji AI
Persoalan yang munasabah ialah mengapa perlu mencipta 1.35 juta orang yang tidak wujud, sedangkan data sebenar sudah ada.
Jawapannya ada dua bahagian. Pertama, data penduduk sebenar tidak boleh digunakan secara bebas untuk menguji sistem AI, kerana ia tertakluk kepada undang-undang perlindungan data. Kedua, walaupun dibenarkan, seseorang individu hanya mewakili dirinya sendiri. Untuk melihat sama ada sesuatu model AI gagal secara sistematik bagi satu kumpulan penduduk, anda perlukan kumpulan itu dalam bilangan yang cukup besar dan seragam bentuknya.
YTL AI Labs memberi beberapa contoh penggunaan. Ejen khidmat pelanggan boleh diuji terhadap pelanggan sintetik daripada pelbagai umur, negeri, pekerjaan dan bahasa. Sebuah bank boleh menilai sama ada AInya memahami cara orang Malaysia yang berbeza menyatakan keperluan kewangan. Agensi kerajaan boleh menguji sama ada perkhidmatan digitalnya berkesan merentas kumpulan sosioekonomi yang berbeza. Penyelidik pula boleh mengenal pasti kumpulan mana yang modelnya sentiasa gagal.
Apa yang saya semak sendiri, dan apa yang saya tidak jumpai
Pengumuman itu jelas dan liputannya meluas dalam media Malaysia. Tetapi ada satu perkara yang perlu dicatat, dan ia bukan tuduhan, hanya pemerhatian pada tarikh tertentu.
Pada 28 September 2026, saya semak katalog awam NVIDIA di Hugging Face, tempat dataset lain dalam siri Nemotron-Personas diterbitkan. Dataset Korea, Belgium, Vietnam, El Salvador, Perancis, Singapura, Brazil, Jepun, India dan Amerika Syarikat semuanya ada di sana. Dataset Malaysia belum ada dalam katalog itu.
Ini tidak bermakna pengumuman itu tidak benar. Ia bermakna fail sebenar belum muncul di tempat yang biasanya digunakan orang untuk memuat turunnya ketika saya menyemak, iaitu lima hari selepas pengumuman. Bagi pembaca yang mahu menggunakannya, perkara paling berguna ialah menyemak sendiri katalog itu sebelum merancang apa-apa, kerana pengumuman dan penerbitan fail bukan perkara yang sama.
Apa yang persona sintetik tidak selesaikan
Bahagian ini penting kerana dataset sebegini selalu dipersembahkan sebagai penyelesaian kepada masalah berat sebelah dalam AI. Ia membantu, tetapi ia tidak menghapuskan masalah itu.
Persona ini dijana daripada jadual kebarangkalian yang datang daripada statistik penduduk. Kalau statistik itu sendiri tidak lengkap bagi sesuatu kumpulan, keluaran personanya juga tidak lengkap, kerana taburan yang salah menghasilkan orang sintetik yang salah. Sebagai contoh, taburan pekerjaan yang dikumpulkan secara kasar bagi pekerja tidak formal akan menghasilkan persona yang mewakili mereka secara kasar juga.
Yang kedua, persona ialah profil, bukan orang. Ia mengandungi ciri seperti umur, pekerjaan dan keperibadian, tetapi ia tidak boleh memberitahu anda bagaimana seseorang itu benar-benar bercakap apabila dia marah kerana bilnya salah. Untuk itu, masih perlu ada data bahasa sebenar daripada manusia sebenar, yang dibenarkan penggunaannya.
Kedudukannya dalam usaha AI tempatan
Dataset ini bukan projek terpencil. Pada 17 Mac 2026, YTL AI Labs dan NVIDIA mengumumkan Ilmu-Nemo-30B, sebuah model dengan 30 bilion parameter yang disesuaikan dengan dataset Malaysia dan dibina atas keluarga model terbuka Nemotron. Dataset persona ini mengisi satu bahagian dalam rantaian yang sama, iaitu bahan untuk menguji dan menilai, bukan model itu sendiri.
Apa yang belum diketahui
- Berapa besar fail dataset itu, dan berapa banyak ruang cakera yang diperlukan untuk memuat turunnya.
- Sama ada contoh bahasa di dalamnya benar-benar mengandungi pertuturan Bahasa Melayu yang pelbagai, atau hanya terjemahan daripada satu templat Inggeris.
- Bagaimana ciri keperibadian OCEAN bagi setiap persona dijana, kerana kaedah itu menentukan sama ada ia bermakna atau sekadar hiasan.
- Sama ada dataset itu akan dikemas kini apabila data statistik baharu diterbitkan, atau ia statik seperti kebanyakan dataset penyelidikan.
- Keputusan penilaian bebas, iaitu sama ada model yang dilatih dengan dataset ini benar-benar lebih baik untuk pengguna Malaysia berbanding model yang tidak menggunakannya.
Ringkasnya
YTL AI Labs dan NVIDIA mengumumkan dataset terbuka yang mengandungi 1.35 juta persona sintetik Malaysia, dijana daripada 150,000 rekod asas berdasarkan statistik rasmi negara, dengan 39 medan data setiap persona dan lesen CC-BY-4.0 yang membenarkan penggunaan komersial.
Ia satu langkah yang munasabah ke arah AI yang memahami konteks tempatan, dan ia menjawab masalah nyata, iaitu tiadanya bahan ujian yang mewakili penduduk Malaysia secara menyeluruh. Yang belum diselesaikan ialah perkara yang memang tidak boleh diselesaikan oleh data sintetik, iaitu sama ada sistem ini benar-benar berfungsi untuk orang sebenar. Itu hanya boleh dijawab apabila fail itu diterbitkan dan penilaian bebas dijalankan.
Cara dataset seperti ini sebenarnya digunakan
Supaya ia tidak kekal sebagai konsep, begini bentuk penggunaannya dalam kerja sebenar. Katakan sebuah syarikat utiliti mahu tahu sama ada chatbotnya berfungsi untuk semua pelanggan. Ia memilih satu segmen daripada dataset, contohnya 500 persona berumur antara 50 dan 70 tahun dari kawasan luar bandar, kemudian menjalankan soalan yang sama kepada chatbot itu bagi setiap persona.
Hasilnya bukan jawapan bagi setiap orang, tetapi corak. Kalau chatbot itu berjaya untuk 90 peratus persona bandar tetapi hanya 60 peratus persona luar bandar, itu penemuan yang boleh diukur, bukan andaian. Tanpa dataset begini, ujian seumpama itu mengambil masa berbulan-bulan untuk disediakan, dan selalunya tidak dibuat langsung.
Satu perkara perlu jelas, iaitu dataset ini untuk menguji dan menilai, bukan untuk mengajar model bercakap Bahasa Melayu. Persona ini memberi anda pelanggan ujian yang pelbagai. Ia tidak memberi anda ayat Bahasa Melayu yang baik, kerana ayat tetap perlu datang daripada sumber bahasa yang sebenar.
Kenapa Bahasa Melayu sebagai bahasa utama itu penting
Sebahagian besar alat AI hari ini dibina dan diuji dalam Bahasa Inggeris. Dua kesannya mudah dilihat. Pertama, kos sesuatu teks dalam Bahasa Melayu lebih tinggi kerana ia dipecahkan kepada lebih banyak bahagian sebelum diproses, dan ini bermakna lebih banyak ruang dan masa diperlukan. Kedua, lembaran penilaian yang digunakan untuk mengukur keupayaan model jarang disediakan dalam Bahasa Melayu, jadi kelemahan model itu dalam bahasa kita tidak kelihatan.
Apabila sebuah dataset menjadikan Bahasa Melayu bahasa utama dan bukan terjemahan tambahan, dua masalah itu mula ada jalan penyelesaian. Ia juga menjelaskan mengapa kerjasama dengan pembuat cip dan model besar itu penting. Dataset sahaja tidak cukup tanpa infrastruktur untuk melatih dan menjalankan model, dan infrastruktur itu mahal.
Baca juga di laman ini
Sumber yang disemak
Maklumat dalam tulisan ini disemak dengan sumber di bawah. Bila keadaan berubah (harga, waktu, terma), sumber inilah yang paling tepat — bukan halaman ini.
- YTL AI Labs, Nvidia launch 1.35mil persona Malaysian AI dataset, New Straits Times, 23 September 2026
- YTL AI Labs partners with NVIDIA to create dataset for training Malaysia-context AI, The Edge Malaysia, 23 September 2026
- YTL AI Labs Teams Up With NVIDIA To Build Dataset For Malaysia-Focused AI, Lowyat.NET, 23 September 2026
- YTL AI Labs, NVIDIA launch open dataset reflecting Malaysia's population diversity, The Star, 23 September 2026
- YTL AI Labs, Nvidia Team Up To Advance Malaysia's Sovereign AI Capabilities, Bernama, 17 Mac 2026
- Katalog dataset NVIDIA di Hugging Face, disemak pada 28 September 2026
Dapat tulisan baharu terus ke e-mel
Sekali sekala sahaja: panduan web, berita AI, dan tempat menarik di Kelantan. Tiada iklan, dan e-mel encik tidak dikongsi dengan sesiapa.