Prompt & ChatGPTAI untuk Produktivitas & Operasional

Teknik Prompting yang Menang di Benchmark Belum Tentu Menang di Kasusmu

Teknik Prompting yang Menang di Benchmark Belum Tentu Menang di Kasusmu

Teknik prompting yang menang di benchmark tidak otomatis menang di kasusmu, karena benchmark mengukur rata-rata di ribuan soal umum, sementara pekerjaanmu adalah satu jenis tugas yang sangat spesifik. Cara paling aman: pakai teknik viral itu sebagai kandidat, lalu adu dengan prompt polosmu di 20 sampai 30 contoh nyata dari pekerjaanmu sendiri.

Intinya:

  • Skor benchmark adalah rata-rata lintas ribuan soal beragam, dan rata-rata bisa naik sambil kasus spesifikmu justru turun.
  • Teknik seperti “think step by step” menambah panjang penalaran, dan penalaran panjang tanpa contoh bisa menyeret model menjauh dari jawaban yang sudah benar.
  • Satu-satunya bukti yang berlaku untuk bisnismu adalah hasil tes di data pekerjaanmu sendiri.

Coba kamu bayangin dua orang di posisi yang sama. Keduanya pakai AI untuk memilah pesan masuk dari calon pembeli jadi tiga kategori: tanya harga, tanya stok, komplain.

Orang pertama baca utas viral tentang “prompt rahasia yang bikin AI 40 persen lebih pintar”. Dia tempel kalimat “pikirkan langkah demi langkah sebelum menjawab” di prompt-nya. Hasilnya terasa lebih meyakinkan, karena keluaran AI sekarang panjang, ada penalarannya, kelihatan mikir. Dia tidak pernah mengecek akurasinya.

Orang kedua bikin file berisi 30 pesan asli dari WhatsApp bisnisnya, lengkap dengan kategori yang benar menurut dia sendiri. Dia jalankan prompt polos, hitung berapa yang benar. Lalu dia jalankan versi “langkah demi langkah”, hitung lagi. Dia baru pilih setelah lihat dua angka itu.

Orang kedua butuh waktu satu sore. Setelah itu dia tahu sesuatu yang orang pertama tidak akan pernah tahu.

Kenapa teknik yang juara di riset bisa kalah di pekerjaanmu?

Benchmark adalah kumpulan soal standar yang dipakai untuk membandingkan performa model atau teknik prompting secara terukur. Isinya ribuan soal dari macam-macam jenis: matematika, logika, pengetahuan umum, penalaran teks.

Skor yang dilaporkan dari benchmark adalah satu angka rata-rata. Di balik angka itu ada sebaran. Ada kelompok soal yang naik tajam, ada yang datar, ada yang turun. Ketika rata-ratanya naik, headline-nya jadi “teknik X terbukti lebih baik”. Kelompok yang turun tidak masuk headline.

Nah, di sinilah masalahnya. Bisnismu bukan sebaran. Bisnismu satu titik di dalam sebaran itu. Kalau pekerjaanmu kebetulan duduk di kelompok yang turun, teknik yang “terbukti” itu justru merugikanmu, dan kamu tidak akan sadar karena outputnya kelihatan lebih rapi.

Mekanisme: kenapa penalaran panjang bisa merusak jawaban yang tadinya benar

Chain of thought adalah teknik meminta model menuliskan langkah penalarannya sebelum memberi jawaban akhir. Ada dua rasa: dengan contoh (few-shot, kamu tunjukkan beberapa contoh penalaran yang benar) dan tanpa contoh (zero-shot, kamu cuma tempel kalimat ajaib seperti “pikirkan langkah demi langkah”).

Bedanya besar sekali, dan ini bagian yang jarang dibahas di utas viral.

Kalau kamu kasih contoh, model punya rel. Dia meniru bentuk penalaran yang kamu tunjukkan, dan langkah-langkahnya mengarah ke tempat yang kamu mau.

Kalau kamu tidak kasih contoh, model mengarang relnya sendiri. Untuk tugas yang sebenarnya gampang, ini berbahaya. Klasifikasi pesan tadi contohnya. Pesan “kak ini ready?” itu tanya stok, titik. Model tanpa disuruh mikir akan langsung jawab benar. Model yang disuruh mikir panjang akan mulai mempertimbangkan: mungkin ini tanya harga juga, mungkin ini pembeli yang kecewa karena sebelumnya kehabisan, mungkin konteksnya begini. Tiga paragraf kemudian dia mendarat di kategori yang salah.

Ini mekanisme yang perlu kamu pegang: penalaran tambahan adalah ruang tambahan untuk salah belok. Kalau jawaban langsung sudah benar, setiap langkah tambahan cuma menambah peluang keluar jalur. Teknik itu membayar dirinya sendiri di tugas yang memang sulit dan bertahap, dan merugikan di tugas yang sekali lihat sudah ketahuan jawabannya.

Pola ini berulang di banyak keputusan bisnis. Sesuatu yang terbukti bagus di satu konteks bisa berbalik di konteks lain, sama seperti gaya visual yang perform di satu platform lalu jatuh di platform lain. Bukti dari konteks orang lain adalah petunjuk arah, dan petunjuk arah harus diverifikasi sebelum dijadikan aturan.

Kenapa kamu merasa teknik itu berhasil padahal belum tentu

Ada tiga hal yang menipu penilaianmu.

  • Output panjang terasa lebih pintar. Kamu membaca proses berpikirnya, jadi kamu percaya. Panjang keluaran dan kebenaran keluaran adalah dua hal berbeda.
  • Kamu cuma mengecek beberapa contoh. Biasanya contoh yang kamu ingat, dan yang kamu ingat cenderung yang berkesan, bukan yang mewakili.
  • Kamu tidak punya pembanding. Tanpa menjalankan prompt polos di soal yang sama, kamu tidak tahu apakah AI jadi lebih baik atau cuma jadi lebih bertele-tele.

Baseline adalah versi paling sederhana yang kamu pakai sebagai pembanding. Dalam prompting, baseline-mu adalah instruksi polos tanpa trik apa pun. Tanpa baseline, semua perbaikan cuma perasaan.

Kenapa ini penting kalau timmu tipis dan budgetmu terbatas

Perusahaan besar punya orang khusus yang kerjanya mengukur kualitas output AI. Kamu mungkin tidak. Justru karena itu, ongkos salah pilih teknik lebih mahal untukmu.

Baca jugaPrompt & ChatGPTMeta-Prompting, Cara Bikin Mesin yang Nulisin Prompt Buat Kamu

Bayangkan prompt klasifikasi tadi kamu pakai untuk menyortir pesan masuk setiap hari. Setiap kesalahan kategori berarti satu calon pembeli dapat balasan yang tidak nyambung. Itu bukan kesalahan yang muncul di dashboard. Itu kesalahan yang muncul sebagai orang yang diam lalu pergi.

Ada juga ongkos yang lebih sunyi: token. Prompt yang menyuruh model menulis penalaran panjang menghasilkan keluaran berkali lipat lebih panjang. Untuk pekerjaan volume tinggi, kamu membayar lebih banyak untuk hasil yang belum tentu lebih baik.

Dan ada ongkos waktu. Setiap teknik baru yang kamu adopsi tanpa uji adalah utang. Suatu hari sistemmu berperilaku aneh, dan kamu harus membongkar tumpukan trik yang tidak pernah kamu ukur satu per satu.

Kapan teknik penalaran panjang justru pilihan yang tepat

Saya tidak sedang bilang chain of thought itu buruk. Teknik ini punya wilayah menangnya sendiri.

  • Tugas bertahap yang jawabannya bergantung pada hasil langkah sebelumnya. Hitungan margin bertingkat, penjadwalan dengan banyak syarat, analisis data yang butuh urutan.
  • Tugas yang butuh audit. Kalau kamu perlu tahu kenapa AI memutuskan sesuatu, penalaran tertulis itu nilainya ada di transparansinya.
  • Tugas ambigu yang memang butuh pertimbangan. Menilai apakah sebuah keluhan pelanggan perlu eskalasi, misalnya.

Dan kalaupun kamu mau pakai penalaran, versi dengan contoh hampir selalu lebih aman daripada versi kalimat ajaib. Few-shot prompting adalah teknik memberi beberapa contoh input dan output yang benar di dalam prompt, supaya model meniru polanya. Contoh memberi rel. Kalimat ajaib tidak.

Jebakannya: hasil tesmu juga punya batas

Ini bagian yang harus saya sebut supaya kamu tidak menukar satu kepercayaan buta dengan kepercayaan buta yang lain.

Tes 30 contoh bukan bukti ilmiah. Kalau dua prompt beda tipis, selisih itu bisa jadi kebetulan. Yang layak kamu percayai adalah selisih yang jelas, misalnya satu prompt benar di sebagian besar contoh dan satunya meleset di banyak tempat.

Hasil tesmu juga terikat pada model yang kamu pakai saat itu. Ganti model, hasilnya bisa bergeser. Jadi tes ini punya masa berlaku, dan kamu jalankan ulang setiap ada perubahan besar.

Dan yang paling sering terlewat: kalau contoh-contoh tesmu tidak mewakili pekerjaan nyata, angkamu bohong dengan sopan. Ambil contoh acak dari pekerjaan asli, termasuk yang berantakan. Kasus yang aneh justru yang paling informatif, mirip cara mengecek apakah pembeli benar-benar memakai produkmu alih-alih puas dengan angka penjualan di permukaan.

Yang bisa kamu lakukan minggu ini

Ini bisa selesai dalam satu sore. Ambil satu tugas AI yang paling sering kamu jalankan.

  1. Kumpulkan 20 sampai 30 contoh nyata. Salin dari pekerjaan asli minggu lalu. Jangan bikin contoh karangan yang rapi.
  2. Tentukan jawaban benarnya dulu. Tulis sendiri apa output yang kamu anggap tepat untuk tiap contoh. Ini yang bikin penilaianmu tidak geser di tengah jalan.
  3. Jalankan prompt polosmu ke semua contoh. Hitung berapa yang benar. Ini baseline-mu.
  4. Jalankan versi dengan teknik yang mau kamu uji. Satu teknik saja per putaran. Kalau kamu ubah tiga hal sekaligus, kamu tidak akan tahu mana yang bekerja.
  5. Bandingkan dua angka itu, dan lihat juga yang salahnya. Pola kesalahan lebih berguna daripada skornya. Kalau semua kesalahan menumpuk di satu jenis kasus, kamu tahu persis apa yang harus diperbaiki.
  6. Simpan filenya. Ini jadi alat ujimu untuk selamanya. Setiap kali kamu mau ubah prompt atau ganti model, kamu tinggal jalankan ulang.

Eval sederhana adalah kumpulan contoh uji beserta jawaban benarnya, dipakai untuk mengukur apakah perubahan prompt benar-benar memperbaiki hasil. Kamu tidak butuh tool khusus. Spreadsheet sudah cukup.

Yang bikin AI-mu bekerja bukan koleksi teknik paling baru. Yang bikin AI-mu bekerja adalah kamu punya cara untuk tahu mana yang benar-benar membantu, di pekerjaanmu, dengan datamu. Teknik viral itu hipotesis gratis dari internet. Angka dari 30 contohmu sendiri itu bukti.

Mulai dari satu tugas. Satu file. Satu sore. Kalau kamu ingin dibimbing membangun sistem AI yang teruji untuk bisnismu sendiri, program mentoring AI ini dirancang untuk itu.

Pertanyaan yang sering muncul

Apakah "think step by step" selalu bikin ChatGPT lebih akurat?

Tidak selalu. Kalimat itu membantu pada tugas bertahap yang jawabannya butuh urutan, seperti hitungan bertingkat atau analisis dengan banyak syarat. Pada tugas sederhana yang sekali lihat sudah ketahuan jawabannya, penalaran tambahan justru membuka ruang model salah belok. Cara memastikannya adalah menjalankan prompt polos dan versi berpikir pada contoh yang sama, lalu membandingkan hasilnya.

Berapa banyak contoh yang dibutuhkan untuk menguji prompt sendiri?

Dua puluh sampai tiga puluh contoh nyata sudah cukup untuk melihat perbedaan yang jelas antara dua prompt. Jumlah itu masih bisa kamu nilai manual dalam satu sesi kerja. Yang lebih menentukan adalah keterwakilan contohnya. Ambil dari pekerjaan asli, sertakan kasus berantakan dan kasus aneh, karena di situlah perbedaan antar prompt paling kelihatan.

Apa bedanya chain of thought dengan few-shot prompting?

Chain of thought meminta model menuliskan langkah penalarannya sebelum menjawab. Few-shot prompting memberi model beberapa contoh input dan output yang benar supaya dia meniru polanya. Keduanya bisa digabung, dan gabungan itu umumnya lebih stabil. Contoh memberi model arah yang jelas, sementara instruksi berpikir tanpa contoh membiarkan model menentukan sendiri jalur penalarannya.

Kenapa hasil prompting saya berbeda dari yang diklaim di internet?

Klaim di internet biasanya berasal dari rata-rata ribuan soal umum, sementara pekerjaanmu adalah satu jenis tugas spesifik dengan data, bahasa, dan konteks sendiri. Rata-rata bisa naik sambil kasus tertentu turun. Model yang kamu pakai, panjang instruksi, dan format datamu juga berbeda. Hasil yang berlaku untuk bisnismu hanya datang dari pengujian di contohmu sendiri.

Artikel terkait

Butuh bantuan terapkan ini ke bisnismu?

Konsultasi digital marketing & AI langsung dengan Hendra Kuang, strategi berbasis data untuk market Indonesia.

Mulai konsultasi