Apakah AI Dapat Diandalkan?

Apakah AI Dapat Diandalkan? [Video dan Kuis]

Jawaban singkat: AI tidak dapat diandalkan sebagai suatu sifat: hal itu bergantung pada tugas, siklus pengambilan data, dan peran manusia yang masih terlibat. Waktu aktif (uptime) adalah apakah titik akhir merespons; kebenaran (truthfulness) adalah apakah jawaban tersebut benar. Gunakan AI ketika kesalahan tidak terlalu besar atau mudah ditangani; perlambat ketika kesalahan sangat mahal.

Poin-poin penting:

Akuntabilitas: Sebutkan siapa yang melakukan peninjauan, siapa yang dapat menghentikannya, dan siapa yang bertanggung jawab.

Transparansi: Periksa bagian data yang diambil, atau Anda masih berada dalam kebingungan.

Kemampuan audit: Mencatat perintah log, potongan data yang diambil, dan pengiriman sehingga kegagalan dapat dilacak.

Pencegahan penyalahgunaan: Bersikap tertutup terhadap pertanyaan-pertanyaan keuangan; jangan pernah mengarang angka, jangka waktu, atau kebijakan.

Contoh hasil ilustratif: Anggaplah tes ilustratif 20 pertanyaan sebagai peta, bukan sebagai bukti 95%.

Apakah AI Dapat Diandalkan? Infografis

Artikel-artikel yang mungkin ingin Anda baca setelah ini:

🔗 Cara menggunakan AI dalam kehidupan sehari-hari
Temukan cara praktis bagaimana AI dapat menyederhanakan tugas dan rutinitas sehari-hari.

🔗 Cara menggunakan AI di tempat kerja
Pelajari cara-cara praktis untuk meningkatkan produktivitas dan efisiensi dengan AI.

🔗 Bisakah AI berpikir sendiri?
Jelajahi apakah kecerdasan buatan benar-benar dapat berpikir secara mandiri dan bernalar.

🔗 Apa saja jenis-jenis AI?
Pahami jenis-jenis AI utama, kemampuan, dan perbedaan utamanya.

Apa sebenarnya arti "andal" ketika mesin itu hanyalah burung beo statistik?

Dalam percakapan sehari-hari, keandalan berarti sesuatu yang dapat diandalkan.

Dengan otomatisasi yang bisa berbicara, banyak sekali properti berbeda yang tersembunyi di balik satu kata. Faktualitas. Konsistensi. Kalibrasi - apakah kepercayaan model sesuai dengan peluang kebenarannya, atau apakah itu hanya... terdengar yakin. Keamanan. Waktu aktif. Sensitivitas respons cepat. Perilaku pada kasus-kasus ekstrem. Perilaku setelah pergeseran distribusi, ketika dunia nyata bukan dunia pelatihan. Tidak satu pun dari hal-hal itu gagal bersamaan. Itulah bagian yang sering dilewati orang.

Chatbot bisa "aktif" sepanjang minggu dan tetap salah pada Selasa sore. Seorang asisten pemrograman bisa mahir dalam hal kode standar, lalu tiba-tiba membayangkan API yang tampak persis seperti aslinya. Metafora yang sering digunakan adalah "rekan kerja junior". Ini metafora yang tidak sempurna - para junior merasa malu - tetapi lebih mendekati kebenaran daripada "oracle".

Pengujian langsung dapat diandalkan untuk apa, bagi siapa, dan dengan siklus apa di sekitarnya. Jika tidak, Anda menilai blender berdasarkan apakah ia dapat mengolah pajak.

Waktu aktif (uptime) bukanlah kebenaran mutlak - dua jenis "keandalan" yang berbeda

Orang-orang operasional dan orang-orang yang berurusan dengan kebenaran menggunakan kata yang sama dan berbicara tanpa saling memahami.

Uptime adalah "apakah endpoint merespons". Kejujuran adalah "apakah jawabannya seperti itu". Tata kelola memperhatikan keduanya, dan risiko model berada di celah yang buruk. Anda dapat memiliki layanan yang tidak pernah bermasalah dan tetap mengirimkan kebohongan yang lancar ke tiket pelanggan. Andal dalam arti SRE. Tidak andal dalam arti "jangan mengarang kebijakan pengembalian dana".

Kurasa ini sudah jelas jika dituliskan. Tapi tidak jelas pada pukul 4 sore ketika balasannya cepat dan antreannya sangat panjang. Kecepatan terasa seperti kompetensi. Dulu, kelambatan berarti seseorang sedang berpikir. Sekarang, kecepatan adalah isyarat bahwa tidak ada yang berpikir.

Keamanan adalah sumbu lain. Model yang menolak pembobolan sistem yang berbahaya dianggap "andal" dalam evaluasi keamanan, namun tetap dapat mengacaukan ringkasan catatan Anda sendiri.

Lancar tapi salah lebih buruk daripada canggung dan terus terang

Inilah masalah kepercayaan diri, dan inilah masalah yang paling serius.

Akurasi dan kelancaran bercerai, dan kelancaran mempertahankan rumah. Gelar LLM akan memberi Anda ritme, kehati-hatian di tempat yang tepat, mungkin bentuk kutipan yang palsu namun menarik. Otak Anda membaca "orang ini tahu". Padahal itu bukan orang, dan kalibrasinya seringkali buruk - kepercayaan diri tinggi, kebenaran sedang-sedang saja, disampaikan seperti pidato utama.

Jawaban salah yang canggung membuat Anda curiga. Jawaban salah yang lancar membuat Anda berhenti memeriksa. Itu bukan perbedaan kecil; itu adalah keseluruhan cerita dalam satu kalimat yang agak menjengkelkan.

Bias juga ada di sana, tidak selalu sebagai hinaan, lebih sebagai asumsi tentang siapa yang ada di ruangan dan ragam bahasa Inggris mana yang dianggap netral. Orang-orang tertipu karena bahasa adalah antarmuka kepercayaan tertua kita. Jika terdengar seperti ringkasan, kita memperlakukannya seperti ringkasan. Saya terus bermaksud untuk lebih sinis tentang hal itu. Kemudian saya membaca ringkasan yang jernih dan bahu saya langsung lemas. Saat memasuki rapat, ringkasan itu tampak selesai. Kalimat itu terlalu banyak bekerja, dan tetap saja: begitulah cara kesalahan itu masuk ke dalam presentasi.

Keandalan ditentukan oleh situasi, bukan oleh merek

Merek hanyalah pengalih perhatian. Perbandingan yang benar-benar bermanfaat adalah pekerjaan itu sendiri. Barisan orang akan saling berdebat. Itu tidak masalah.

Kasus penggunaan Bagaimana hal itu cenderung gagal Ketika itu "cukup baik" Apa yang masih harus dilakukan manusia Mengapa orang tertipu
Menyusun/merangkum Menghilangkan pengecualian; mengubah kemungkinan menjadi keharusan Pertama-tama, teks yang sudah Anda ketahui Periksa nama, nomor, dan kalimat yang bisa menyakitkan Kedengarannya seperti kamu. Kirim.
Tanya Jawab ala Pencarian Jawaban Fog; penyelamatan nyaris celaka dicatat sebagai fakta Orientasi, bukan kata terakhir Buka kode sumbernya atau Anda hanya punya firasat saja Nada yang sama untuk kata "diperoleh kembali" dan "diciptakan"
Bantuan kode API yang diciptakan; pengujian yang menegaskan adanya bug Teks standar, perekat, "jelaskan kesalahan ini" Jalankan. Baca perbedaannya. (Maaf, ini ceramah yang agak menggurui.) Gaya rumah. Tes yang tampak ramah lingkungan.
Dukungan pelanggan Kebijakan yang dibuat-buat; jawaban salah yang sopan Draf dalam kebijakan yang ketat Miliki kendali atas pengiriman uang dan percayalah pada hal tersebut Cepat + ramah. Tidak ada yang mengaudit pesan kelima.
Nasihat medis/hukum Lancar, terstruktur, sangat yakin akan hal-hal buruk Hampir tidak pernah sebagai produk Bersikaplah profesional. Model ini hanyalah contoh. Jika kedengarannya kasar, tidak apa-apa. Berbicara seperti sebuah ringkasan.
Penilaian/Peringkat Fitur proksi; pergeseran; kasus tepi yang terabaikan Anda akan mengesampingkan triase Periksa ekornya secara acak Angka-angka terasa dewasa. Dasbor terasa seperti tata kelola. Padahal, keduanya tidak sepenuhnya demikian.
Pembuatan gambar Tangan, siku tambahan, sisa-sisa stereotip Moodboard, contoh desain sementara - bukan bukti Perhatikan dua kali, maknanya bukan hanya artefaknya Pretty membungkam sisi skeptis itu
Agen otonom Penggunaan alat yang percaya diri; kesalahan yang berakumulasi Jalur sempit dengan sakelar pemutus daya Tetaplah berpegang pada kail. Batasi apa pun yang dapat disentuhnya. Rencana yang diberi nomor mencerminkan kompetensi. Seringkali, itu hanyalah daftar tugas yang diberi penggerak.

Pokoknya. Jika alat favorit Anda mahir dalam membuat draf dan Anda mendapati diri Anda memintanya untuk memberikan kenyamanan yang berkaitan dengan hukum di tengah malam, itu bukanlah peningkatan. Itu adalah peta yang mengatakan Anda telah meninggalkannya.

Halusinasi, hanyut, dan kesalahan yang tenang

Halusinasi menjadi berita utama karena sifatnya yang sensasional: sebuah buku yang tidak ada, sebuah fungsi yang tidak pernah diluncurkan, sebuah klausul kebijakan dengan angka yang terasa resmi.

Drift kurang sinematik. Dunia bergerak. Sisa-sisa model tetap ada. Anda mengajukan pertanyaan yang membutuhkan konteks baru dan Anda mendapatkan jawaban yang terorganisir dengan baik dari cuaca sebelumnya. Saya hampir menulis "dari era lain" di sana, yang merupakan pernyataan berlebihan yang ditimbulkan oleh topik ini. Ini bukan era lain. Ini hanya bukan sekarang.

Kesalahan yang tersembunyi adalah hal yang lebih saya pedulikan. Ringkasan yang menghilangkan pengecualian. Parafrase yang mengubah kemungkinan menjadi keharusan. Fakta bisa "secara teknis baik-baik saja" sementara maknanya telah bergeser.

Sensitivitas yang terburu-buru justru memperburuk keadaan. Ubah kemasannya dan "fakta" akan berkilau. Bertanya sebagai seorang skeptis, yang didapat adalah jawaban yang berbelit-belit. Bertanya sebagai bos yang sedang terburu-buru, yang didapat adalah klaim berlebihan yang cepat. Jika evaluasi Anda hanya menggunakan satu cara penyampaian, evaluasi Anda sedikit berbohong. Maaf.

Aksi pembobolan penjara berada di ambang batas, dan saya tidak menginginkan film perampokan. Jika suatu sistem dapat dibujuk untuk mengabaikan tata kramanya, keandalan bukan hanya tentang kebenaran; tetapi juga tentang apakah pembatasnya berupa lingkaran atau hanya pajangan.

Sisa-sisa pelatihan, pengetahuan usang, dan mengapa latihan penguatan diri bukanlah tongkat ajaib

Model generatif dilatih pada sebuah tumpukan data, lalu diarahkan ke hari Selasa Anda. Pengambilan kembali adalah upaya serius untuk menempatkan masa kini pada tumpukan data tersebut. Penguatan berarti "menjawab dari ini, bukan dari kabut". Ketika gagal, kegagalan itu dilakukan dengan sopan.

Kegagalan klasik: pengambil dokumen menemukan dokumen yang hampir cocok. Generator menuliskannya dengan tenang. Anda melihat objek berbentuk sumber dan insting pengecekan Anda berhenti bekerja. Saya melakukan ini. Anda mungkin juga melakukan ini. Ide kutipan itu benar; implementasinya hanya sebaik kecocokannya.

Pengetahuan usang adalah kebocoran lainnya. Beberapa tugas membutuhkan kondisi yang dinamis - harga, inventaris, rumusan kebijakan saat ini. Beberapa membutuhkan keahlian yang stabil, seperti cara menyusun memo. Campurkan keduanya dan Anda akan mendapatkan jawaban yang sangat pasti tentang dunia yang telah berubah. Pergeseran distribusi adalah nama yang lebih dewasa: distribusi dinamis bukanlah distribusi pelatihan, dan kasus-kasus ekstrem berada di celah tersebut.

Satu hal lagi, yang saya sebutkan dengan tanda hubung yang salah tempat karena begitulah catatan saya terlihat: grounding adalah lantai—bukan halo. Jika Anda tidak dapat memeriksa potongan yang diambil, Anda masih berada dalam kabut, hanya dengan pencahayaan yang lebih baik.

Teater evaluasi: mengapa demonstrasi adalah ujian yang buruk

Demo adalah soal pencahayaan. Tolok ukur sedikit lebih jujur, dan tetap bukan tugas Anda.

Sebuah petunjuk yang jelas dan tugas yang sudah sering kita lihat pada model serupa - tentu saja terlihat bagus. Evaluasi yang hanya mengukur apa yang diukur sama saja dengan mengukur sebuah sandiwara. Alur kerja langsung memiliki tempelan yang kusut, file yang hilang, dan pengguna yang akan menerima jawaban pertama yang mengurangi kecemasan mereka.

Tolok ukur itu penting. Hanya saja, tolok ukur tidak selalu mudah dibawa ke mana-mana seperti yang diklaim oleh presentasi. Skor di papan peringkat bukanlah kalibrasi pada tiket Anda. Risiko model dalam sebuah perusahaan adalah "apa yang terjadi ketika ini salah dalam skala besar", bukan "apakah ini lolos uji trivia". Tes yang Anda butuhkan bersifat lugas: tetap berada di dalam bagian yang diambil; tandai ketidakpastian alih-alih menggertak; tetap konsisten saat Anda merumuskan ulang; gagal secara tertutup (menolak, bertanya, menunda) daripada gagal secara terbuka (mengarang).

Saya pernah melihat orang menganggap satu keberhasilan yang mengesankan sebagai bukti. Itu seperti memutuskan sebuah restoran "andal" hanya karena hidangan pembukaannya cantik. Mungkin memang begitu. Mungkin dapurnya punya waktu sepuluh menit yang bagus.

Sedikit kontradiksi akan muncul: Saya masih menggunakan demo untuk mendapatkan gambaran. Hanya saja saya tidak merekrut berdasarkan gambaran tersebut.

Apakah AI dapat diandalkan? Hanya jika masih ada seseorang yang bertanggung jawab

Keterlibatan manusia dalam proses pengambilan keputusan adalah satu-satunya desain yang sesuai dengan mode kegagalan yang ada.

Jika tidak ada yang bertanggung jawab, sistem akan digunakan seolah-olah ada yang bertanggung jawab. Tata kelola adalah istilah yang kurang menarik untuk "siapa yang meninjau, siapa yang dapat menghentikannya, apa yang dicatat, apa yang terjadi setelah kesalahan". Agen membuat hal ini lebih jelas karena mereka mengambil tindakan, bukan hanya paragraf. Draf yang tidak Anda kirim itu murah. Panggilan alat yang tidak Anda maksudkan itu tidak murah.

Sebutkan siapa yang bertanggung jawab. Jika jawabannya "model", Anda tidak punya jawaban. Model tidak akan datang ke pertemuan setelah kejadian. Seseorang yang datang, atau mungkin penyedot debu yang datang, lalu pengacara.

Pilihlah pemeriksaan yang sesuai dengan radius ledakan. Tinjauan tingkat pengejaan untuk unggahan media sosial. Pemeriksaan sumber untuk apa pun yang mengklaim fakta. Seorang profesional untuk segala sesuatu yang berkaitan dengan kedokteran, hukum, kredit, operasi kritis keselamatan. Untuk hal-hal tersebut, manusia tidak "terlibat". Manusia adalah inti dari proses tersebut. Modelnya hanyalah rintisan. Itu bukanlah skeptisisme sebagai kepribadian. Itu adalah selera.

Saat ini trennya adalah menyembunyikan cek di balik tombol kirim yang mengkilap. Sekarang ini, begitulah cara Anda secara tidak sengaja mengotomatiskan sebuah rumor. Belakangan ini saya lebih teliti dalam hal ini, dan hasilnya lebih baik.

Bagaimana cara bertanya agar Anda bisa menghindari kesalahan?

Anda dapat menginterogasi sistem-sistem ini tanpa harus menjadi seorang yang secara profesional meragukan sinar matahari.

  • Mintalah ketidakpastian dengan sengaja. "Apa yang akan membuat ini salah?" lebih baik daripada "buatlah ini menjadi pasti".

  • Pisahkan proses pengambilan informasi dari proses pembuatan informasi jika memungkinkan. Lihatlah bagian-bagian teks terlebih dahulu. Kemudian mintalah rangkuman tulisannya.

  • Ganti kostumnya. Susun ulang kalimatnya. Mintalah untuk berargumen sebaliknya. Sensitivitas terhadap rangsangan adalah seperti senter jika Anda menggunakannya dengan cara itu.

  • Batasan paksa: "hanya dari teks yang saya tempel", "jika hilang, katakan hilang". Model-model ini secara mengejutkan patuh pada hal ini... sampai akhirnya tidak. Periksa saja.

  • Lebih baik mengerjakan tugas yang memiliki pemeriksa. Kompilator, linter, pengecekan skema, dan pengawasan dari pihak lain. Keandalan akan lebih baik jika ada penilai.

  • Perhatikan ciri-cirinya: kekhususan yang berlebihan. Angka yang tampak tepat, kasus yang disebutkan namanya, klausa bernomor yang rapi - di situlah halusinasi suka menyamar.

  • Pertahankan jejak manusia. Jika antarmuka pengguna menyembunyikan pemeriksaan, orang akan melewatkannya. Itu hanyalah elemen dekoratif, bukan kesalahan moral.

Semua ini tidak membuat model tersebut "benar". Ini membuat siklus tersebut kurang mudah tertipu. Yang, kurasa, adalah hasilnya.

Ke mana peta membawa Anda

Jadi, pertanyaan ya/tidak hanya berfungsi sebagai pintu masuk.

Apakah AI dapat diandalkan? Bukan sebagai sifat. Melainkan sebagai properti dari suatu tugas, kumpulan data, siklus pengambilan, evaluasi yang bukan demonstrasi, dan manusia yang masih harus bersungguh-sungguh. Kelancaran akan terus menipu kita karena kita adalah makhluk berbahasa dan sistem ini adalah mesin bahasa. Waktu aktif akan terus dikacaukan dengan kebenaran karena keduanya terasa seperti "berhasil". Asisten akan terus mendapatkan penghasilan mereka di tengah-tengah yang kusut - draf, ringkasan yang dapat Anda baca sekilas, kode yang dapat Anda kompilasi - dan tidak aman ketika kita menyerahkan penilaian kepada sebuah paragraf yang tidak peduli.

Gunakanlah di tempat di mana kesalahan kecil tidak merugikan atau mudah diatasi. Perlambatlah di tempat di mana kesalahan besar akan merugikan. Itulah jawaban yang sebenarnya, dan itu lebih berharga daripada sekadar slogan.

Jika Anda mengambil satu hal: berhentilah bertanya pada model apakah ia yakin. Perhatikan apa yang terjadi ketika Anda bertanya bagaimana ia bisa salah. Kemudian periksa kembali.

Contoh nyata: Membangun asisten AI untuk kebijakan keanggotaan

Skenario

Priya mengelola basis pengetahuan untuk Harbour Membership, sebuah badan perdagangan Inggris beranggotakan 70 orang untuk pusat kebugaran independen. Tiga orang menjawab pertanyaan anggota. Sumber informasi utamanya adalah buku panduan setebal 180 halaman, yang diperbarui setiap triwulan, ditambah PDF lama di drive bersama yang tidak tega dihapus oleh siapa pun.

Pimpinan sudah membeli asisten helpdesk. Demonya cukup bagus. Waktu operasionalnya baik-baik saja. Pada minggu kedua, draf yang lancar memberi tahu anggota bahwa mereka dapat membekukan akun selama 14 hari dan mendapatkan pengembalian dana penuh "sebagai standar". Itu bukan kebijakan resmi. Agen tersebut menyadarinya karena mereka masih membuka buku panduan ketika ada uang yang terlibat. Pertanyaan pimpinan, yang dikirim seolah-olah jawabannya ya atau tidak, adalah: apakah AI dapat diandalkan?

Priya menolak keputusan itu. Dia menganggapnya sebagai peta. Tugasnya bukan "memberi anggota ramalan". Tugasnya adalah "menyusun jawaban dari buku panduan yang ada, menunjukkan bagian yang relevan, dan menyatakan penolakan jika bagian tersebut tidak ada". Jika asisten tidak dapat melakukan itu, maka ia hanyalah mainan penyusun draf, bukan meja kebijakan.

Apa yang dibutuhkan asisten

  • Buku panduan April 2026 sebagai satu-satunya korpus yang diizinkan, dengan nomor bagian tetap utuh

  • File PDF lama tahun 2023 sengaja dibiarkan di drive, agar mereka dapat melihat apakah proses pengambilan data berhasil menangkap data yang hampir hilang

  • Aturan tertulis: tidak ada data pribadi pelanggan dalam alat konsumen; tidak ada pengiriman tanpa campur tangan manusia; tidak ada pembuatan angka, jendela, atau klausa "sebagai standar"

  • Izin untuk mencatat perintah, potongan data yang diambil, dan pengiriman akhir

  • Seorang pemilik bernama (Priya) yang akan menilai serangkaian tes dan menghentikan kopilot jika gagal, menutup jawaban yang lebih buruk daripada lemparan koin pada pertanyaan tentang uang

  • Jika alat tersebut mendukung pengambilan data, bagian yang diambil harus terlihat di samping draf. Jika tidak, mereka akan menempelkan bagian tersebut secara manual. Pengangkutan tanpa jalur yang dapat diperiksa tetaplah sebuah kabut.

Contoh instruksi

Priya menyampaikannya dengan bahasa sehari-hari, bukan seperti dalam naskah drama:

Jawablah hanya berdasarkan kutipan dari buku panduan April 2026 yang telah diberikan kepada Anda. Sebutkan nomor bagiannya. Jika jawabannya tidak ada dalam kutipan tersebut, katakan "tidak ada dalam buku panduan saat ini" dan berhenti. Jangan mengarang jendela pembekuan, aturan pengembalian dana, atau biaya. Jangan mengubah "atas kebijakan gym" menjadi "sebagai standar". Jika dua kutipan bertentangan, tunjukkan keduanya dan sebutkan mana yang berlaku saat ini. Anda sedang menyusun draf untuk manusia yang akan membuka kode sumber sebelum diberikan kepada anggota.

Kemudian dia menyimpan instruksi kedua untuk dirinya sendiri, karena poin utama artikel ini adalah tentang perulangan, bukan modelnya:

Sebelum mengirim, buka bagian yang dikutip. Tanyakan "apa yang membuat ini salah?" Jika draf berisi angka yang tidak ada dalam bagian tersebut, tolak saja. Jika saya bertanya seperti seorang bos yang terburu-buru, tanyakan lagi seperti seorang skeptis dan bandingkan.

Draf yang baik terlihat seperti ini: "Tidak tercantum dalam buku panduan saat ini (April 2026, bagian 4.2). Pembekuan keanggotaan tergantung kebijakan gym. Pengembalian dana tidak otomatis. Silakan laporkan ke pihak yang berwenang." Draf yang buruk terlihat seperti ini: "Anggota dapat membekukan keanggotaan selama 14 hari dan menerima pengembalian dana penuh sebagai standar. Dikonfirmasi dalam buku panduan." Nada yang sama. Hanya satu dari keduanya yang merupakan kebijakan.

Bagaimana cara mengujinya?

Priya menulis 20 pertanyaan sebelum melihat output dari copilot. Urutan itu penting. Demo adalah tentang pencahayaan. Ini adalah uji coba kering.

Ini bukan sekadar kuis. Ini adalah siaran langsung:

  • Delapan pertanyaan yang jawabannya terdapat dalam satu bagian saat ini (yang mudah)

  • Empat kali nyaris sama, di mana PDF 2023 lebih mirip dalam susunan kata daripada teks April

  • Tiga pertanyaan yang "tidak ada dalam buku panduan" (perselisihan penagihan, pertanyaan terkait medis "apakah pelatihan ini aman", dan perubahan kecil terkait hukum dalam kontrak)

  • Tiga pertanyaan soal keuangan (pembekuan, pengembalian dana, biaya pendaftaran)

  • Dua pertanyaan umum dari anggota (jam buka, asuransi pelatih)

Dua dari dua puluh pertanyaan tersebut juga diajukan kembali dengan kostum kedua, sekali sebagai bos yang terburu-buru dan sekali sebagai orang yang skeptis, sebagai pengecekan sensitivitas terhadap isyarat. Pengajuan ulang tersebut dicatat, dan tidak digabungkan ke dalam skor 20 item.

Rubrik, dinilai oleh Priya dengan buku panduan terbuka: lulus membutuhkan aturan terkini yang tepat, nomor bagian yang sebenarnya, dan tidak ada klausa tambahan yang dibuat-buat. Gagal secara diam-diam adalah kalimat yang secara teknis baik tetapi menghilangkan pengecualian atau mengubah kemungkinan menjadi keharusan. Gagal secara terbuka adalah angka yang dibuat-buat atau PDF yang hampir memenuhi syarat tetapi diperlakukan sebagai aturan terkini. Waktu aktif dihitung secara terpisah, karena "itu menjawab" bukanlah "itu memang demikian".

Penerimaan untuk melangkah lebih jauh: pada pertanyaan keuangan, lebih baik ditutup daripada dibuka. Jika kopilot menciptakan jendela pengembalian dana, ia tidak membuat tiket langsung. Jika tidak ada yang mau membuka kode sumber, ia juga tidak membuat tiket langsung.

Hasil

Hasil ilustratif, dari tes fiktif 20 pertanyaan, bukan angka keanggotaan Harbour yang dipublikasikan.

Asumsi: satu asisten helpdesk; buku panduan April 2026 ditambah PDF sisa tahun 2023; Priya dinilai berdasarkan rubrik di atas; waktu diukur dengan stopwatch ponsel dari pertanyaan yang ditempel hingga "Saya akan mengirimkan ini"; waktu peninjauan disertakan dalam kondisi berulang dan dikecualikan dalam kondisi tidak diperiksa, dengan sengaja, sehingga perbandingan tetap seimbang.

Copilot yang tidak tercek, petunjuk bergaya demo: 20 dari 20 pertanyaan mendapat jawaban lancar (waktu aktif tampak sempurna). 11 dari 20 memenuhi kriteria. Lima gagal secara diam-diam. Empat gagal secara terbuka, termasuk pembekuan 14 hari. Dua dari empat kegagalan terbuka tersebut mengutip bagian berbentuk sumber dari PDF 2023. Waktu rata-rata untuk draf yang tampak siap kirim adalah 1 menit.

20 pertanyaan yang sama, instruksi terbatas, bagian yang diambil terlihat: 15 dari 20 pertanyaan benar sepenuhnya dari teks April. Tiga pertanyaan dengan benar menyatakan "tidak ada dalam buku panduan saat ini" (item yang berkaitan dengan medis dan hukum, ditambah satu sengketa penagihan), sehingga 18 dari 20 pertanyaan dapat diterima. Dua pertanyaan masih gagal: satu pertanyaan mencakup PDF 2023 yang hampir salah, dan satu pertanyaan mengarang angka biaya pendaftaran yang tidak ada dalam teks. Waktu rata-rata untuk menyusun draf masih sekitar 1 menit.

Sama seperti 20, ditambah Priya membuka bagian yang dikutip sebelum pengiriman simulasi: 19 dari 20 akan dapat diterima. Dia menemukan PDF yang hampir lolos. Kesalahan yang tersisa adalah pengulas membaca sekilas paragraf yang lancar dan tidak memperhatikan angka biaya pendaftaran yang dibuat-buat. Waktu rata-rata, termasuk peninjauan, adalah 3 menit.

Proses lama, pencarian hanya di buku panduan, tanpa asisten: 20 dari 20 dapat diterima. Median 9 menit.

Pada sampel ini, metode copilot yang menggunakan loop lebih cepat 6 menit daripada metode pencarian manual (9 dikurangi 3), atau 120 menit untuk 20 pertanyaan, dengan 19 dari 20 jawaban yang dapat diterima, bukan 20 dari 20. Metode copilot yang tidak diperiksa lebih cepat 8 menit (9 dikurangi 1) dan salah, baik secara diam-diam maupun terang-terangan, pada 9 dari 20 pertanyaan. Itu bukanlah penghematan waktu 67% yang dapat Anda masukkan ke dalam paket kontrol. Itu adalah kebocoran 9 kesalahan yang seharusnya dapat Anda otomatiskan.

Versi pertanyaan berulang yang diajukan atasan dengan tergesa-gesa itu sama-sama berlebihan. Versi skeptisnya bertele-tele. Model yang sama, buku panduan yang sama, kostum yang berbeda. Priya mencatat itu sebagai temuan, bukan sebagai kepribadian.

Angka-angka ini adalah perkiraan contoh berdasarkan pengujian yang dinyatakan, sejumlah kecil data, tiket yang lebih mudah daripada anggota yang marah, dan satu peninjau yang sudah mengetahui buku tersebut. Angka-angka ini tidak menunjukkan bahwa kopilot "95% dapat diandalkan", atau bahwa Harbour harus memecat seorang petugas meja. Angka-angka ini menunjukkan bahwa waktu operasional bukanlah masalahnya, dan yang menjadi masalah adalah pemeriksaannya.

Apa yang bisa salah?

  • Kepemimpinan menyebutkan waktu draf 1 menit dan mengabaikan 9 kesalahan. Kecepatan masih terasa seperti kompetensi pada pukul 4 sore.

  • PDF tahun 2023 tetap ada dalam indeks. Pencarian terus mengambilnya. Tampilannya sudah matang namun tetap hampir berhasil.

  • UI menyembunyikan bagian data yang diambil di balik tombol kirim yang menarik. Orang-orang berhenti membuka buku panduan, dan itulah cara jawaban tentang pembekuan data sampai ke anggota.

  • Priya hanya memberi nilai pada delapan pertanyaan mudah karena pertanyaan-pertanyaan itu terlihat lebih bagus di dalam slide. Teater evaluasi, hanya saja menggunakan spreadsheet.

  • Jawaban yang bernuansa medis seperti "apakah pelatihan ini aman?" diperbolehkan untuk terlihat seperti penjelasan singkat. Peta tersebut mengatakan hampir tidak pernah. Nada bicaranya mengatakan silakan lanjutkan.

  • Catatan log dimatikan karena "terasa seperti tambahan". Setelah terjadi kesalahan, tidak ada yang bisa melihat bagian mana yang berhasil diambil.

  • Mereka bertanya pada model apakah model itu yakin. Model itu yakin. Itu bukanlah tujuan pengujian sebenarnya.

Kesimpulan praktis

Keandalan bukanlah sifat dari kopilot yang dibeli Harbour. Itu adalah sifat dari 20 pertanyaan, buku panduan terkini, bagian yang terlihat, dan seseorang yang masih membuka sumbernya ketika uang terlibat. Kelancaran akan terus lolos uji waktu aktif. Perulangan adalah satu-satunya hal yang lolos uji kebijakan.

Pertanyaan yang Sering Diajukan (FAQ)

Apa sebenarnya arti "andal" bagi AI generatif?

Keandalan sehari-hari berarti Anda dapat mengandalkan sesuatu. Dengan otomatisasi yang dapat berkomunikasi, seluruh rangkaian properti tersembunyi di bawah satu kata: faktualitas, konsistensi, kalibrasi, keamanan, waktu aktif, sensitivitas terhadap perintah, kasus ekstrem, dan perilaku setelah pergeseran distribusi. Tidak satu pun dari hal-hal tersebut gagal secara bersamaan. Pengujian langsung dapat diandalkan dalam hal apa, untuk siapa, dan dengan siklus apa di sekitarnya. Jika tidak, Anda menilai blender berdasarkan apakah ia dapat mengolah pajak.

Apakah AI Dapat Diandalkan?

Bukan sebagai sifat bawaan. Seorang LLM (Learning Learning Manager) bisa sangat handal dalam satu pekerjaan dan diam-diam kehilangan kendali di pekerjaan berikutnya, terkadang dalam waktu yang sama, terkadang hanya karena Anda memindahkan koma. Keandalan adalah properti dari suatu tugas, kumpulan data, siklus pengambilan data, evaluasi yang bukan demonstrasi, dan manusia yang tetap harus bersungguh-sungguh. Gunakan keandalan di tempat di mana kesalahan tidak terlalu besar atau mudah diperbaiki. Perlambat di tempat di mana kesalahan akan sangat merugikan.

Apakah waktu aktif AI sama dengan kejujuran?

Tidak. Uptime adalah apakah endpoint merespons. Kejujuran adalah apakah jawabannya memang demikian. Anda bisa memiliki layanan yang tidak pernah berkedip dan tetap mengirimkan kebohongan yang lancar ke dalam tiket pelanggan. Kecepatan terasa seperti kompetensi ketika antriannya sangat panjang. Keamanan adalah sumbu lain: model yang menolak jailbreak mungkin masih mengacaukan ringkasan catatan Anda sendiri.

Mengapa AI yang fasih terasa dapat dipercaya bahkan ketika ia salah?

Akurasi dan kelancaran dipisahkan, dan kelancaranlah yang mempertahankan rumah. Seorang LLM akan memberi Anda ritme, kehati-hatian, mungkin bentuk kutipan yang palsu namun menarik, dan otak Anda membaca "orang ini tahu." Kalibrasi seringkali buruk: kepercayaan diri tinggi, kebenaran sedang-sedang saja, disampaikan seperti pidato utama. Jawaban salah yang canggung membuat Anda curiga. Jawaban salah yang lancar membuat Anda berhenti memeriksa. Jika disampaikan seperti ringkasan, kita memperlakukannya seperti ringkasan, dan itulah bagaimana kesalahan masuk ke dalam presentasi.

Apakah AI dapat diandalkan untuk pekerjaan medis, hukum, atau dukungan pelanggan?

Itu tergantung pada pekerjaannya, bukan mereknya. Saran medis dan hukum hampir tidak pernah cukup baik sebagai produk: modelnya hanyalah contoh dan manusianya adalah profesional. Dukungan pelanggan dapat menyusun kebijakan yang ketat, tetapi seseorang harus bertanggung jawab atas pengiriman uang dan kepercayaan, karena kebijakan yang dibuat-buat dan penolakan yang sopan adalah kegagalan yang biasa terjadi. Draf dan ringkasan adalah langkah pertama pada teks yang sudah Anda ketahui. Periksa nama, nomor, dan kalimat yang berpotensi merugikan.

Mengapa AI mengalami halusinasi, penyimpangan, atau kesalahan yang terjadi secara diam-diam?

Halusinasi adalah kegagalan yang pedas: sebuah buku yang tidak ada, sebuah fungsi yang tidak pernah diluncurkan, sebuah klausul kebijakan dengan angka yang terasa resmi. Pergeseran kurang sinematik: dunia bergerak, sisa-sisa model tetap ada, dan Anda mendapatkan jawaban yang terorganisir dengan baik dari cuaca sebelumnya. Kesalahan yang tenang adalah ringkasan yang menghilangkan pengecualian. Atau parafrase yang meningkatkan kemungkinan menjadi keharusan. Faktualitas dapat terlihat baik secara teknis sementara maknanya telah bergeser. Kepekaan yang cepat membuat fakta-fakta berkilau ketika Anda mengubah pembungkusnya.

Apakah penambatan atau pengambilan kembali membuat AI menjadi andal?

Pengaitan dengan kenyataan berarti jawaban dari sini, bukan dari kabut. Pengambilan data mengikat keadaan saat ini ke tumpukan yang terlatih. Ketika gagal, kegagalannya berlangsung dengan sopan: dokumen yang hampir berhasil, tulisan yang disusun, dan insting pengecekan Anda berhenti bekerja. Pengaitan dengan kenyataan adalah dasar, bukan lingkaran cahaya. Jika Anda tidak dapat memeriksa bagian yang diambil, Anda masih berada dalam kabut, hanya dengan pencahayaan yang lebih baik. Gabungkan tugas-tugas yang berkaitan dengan keadaan langsung seperti harga atau rumusan kebijakan dengan keahlian yang stabil, dan Anda akan mendapatkan jawaban yang sangat pasti tentang dunia yang telah berubah.

Mengapa demonstrasi bukan tes yang baik untuk mengukur keandalan AI?

Sebuah petunjuk yang jelas dan tugas yang telah dilihat model ribuan kali akan terlihat bagus. Alur kerja langsung memiliki masalah penempelan yang rumit, file yang hilang, dan pengguna yang akan menerima jawaban pertama yang mengurangi kecemasan mereka. Skor papan peringkat bukanlah kalibrasi pada tiket Anda. Risiko model adalah apa yang terjadi ketika ini salah dalam jumlah besar, bukan apakah itu lulus serangkaian pertanyaan trivia. Tes yang Anda butuhkan itu kering: tetap di dalam bagian yang diambil, tandai ketidakpastian alih-alih menggertak, tetap konsisten saat Anda merumuskan ulang, dan gagal secara tertutup daripada mengarang.

Apakah AI dapat diandalkan jika tidak ada yang bertanggung jawab?

Tidak. Jika tidak ada yang bertanggung jawab, sistem akan digunakan seolah-olah ada yang bertanggung jawab. Keterlibatan manusia adalah satu-satunya desain yang sesuai dengan mode kegagalan: siapa yang meninjau, siapa yang dapat menghentikannya, apa yang dicatat, apa yang terjadi setelah kesalahan. Jika jawabannya adalah "model," Anda tidak memiliki jawaban. Model tidak hadir dalam rapat setelah insiden terjadi. Untuk bidang kedokteran, hukum, kredit, atau operasi yang kritis terhadap keselamatan, manusia adalah inti dari sistem dan model hanyalah pelengkap.

Bagaimana cara saya memberi petunjuk kepada AI agar saya dapat mendeteksi kesalahan?

Mintalah ketidakpastian dengan sengaja: "Apa yang akan membuat ini salah?" lebih baik daripada "buatlah yakin." Pisahkan pengambilan informasi dari pembuatan informasi jika memungkinkan. Lihatlah bagian-bagian teks terlebih dahulu, lalu mintalah penulisannya. Ubah cara penyampaiannya: susun ulang kalimatnya, atau mintalah untuk berargumen sebaliknya. Terapkan batasan seperti "hanya dari teks yang saya tempel" atau "jika hilang, katakan hilang," dan tetap periksa. Lebih sukai tugas dengan verifikasi, dan perhatikan spesifikasi ekstra, karena di situlah halusinasi suka menyamar.

Referensi

  1. NIST - nvlpubs.nist.gov

  2. NIST - airc.nist.gov

  3. NIST - airc.nist.gov

  4. ICO - ico.org.uk

  5. NCSC - www.ncsc.gov.uk

  6. NCSC - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

Temukan AI Terbaru di Toko Resmi Asisten AI

Tentang Kami

Kuis
1. Menurut artikel tersebut, apakah AI dapat diandalkan sebagai suatu sifat?

2. Apa perbedaan antara uptime dan truthfulness?

3. Mengapa jawaban salah yang lancar lebih berbahaya daripada jawaban yang canggung?

4. Dalam contoh tes keanggotaan Harbour yang terdiri dari 20 pertanyaan, apa yang terjadi dengan kopilot yang tidak diperiksa?

5. Menurut artikel tersebut, apa yang dimaksud dengan grounding tanpa potongan yang dapat diperiksa yang telah diambil?


Kembali ke blog