Quality Assurance Call Center: Membuat Form Penilaian dan Proses Kalibrasi
Ringkasan artikel:Panduan ini membahas cara membangun quality assurance call center yang lebih konsisten, mulai dari penyusunan scorecard hingga proses kalibrasi antar-reviewer. Artikel menjelaskan area penilaian seperti pembukaan, verifikasi, diagnosis, solusi, compliance, empati, dan penutupan, termasuk cara menentukan critical error dan bobot penilaian. Dibahas juga sampling, blind review, dispute, coaching, serta hubungan penilaian kualitas agen dengan CSAT dan risiko kepatuhan. Contoh dashboard mingguan membantu tim QA dan supervisor melihat pola yang perlu ditindaklanjuti. Cocok untuk QA manager, supervisor, dan tim compliance yang ingin membuat monitoring call center lebih adil, terukur, dan mudah direview.
Daftar isi
- Mulai dari percakapan yang benar-benar terjadi
- Tidak semua kesalahan harus kehilangan poin dengan cara yang sama
- Definisi tiap poin harus lebih jelas dari kata “baik”
- Ukuran sampel jangan dianggap mewakili semuanya
- Blind review membantu melihat masalah penilai
- Kalibrasi bukan rapat untuk mencari siapa yang benar
- Dispute perlu punya jalur yang normal
- Coaching jangan hanya bicara skor total
- QA score jangan dibaca sendirian
- Contoh dashboard QA mingguan
- Kasus China Customs cukup relevan untuk bagian quality inspection
- AI bisa memperluas coverage, tapi manusia tetap perlu mengkalibrasi
- FAQ
Oleh Siti Ayu
Siti Ayu, Manajer Keberhasilan Pelanggan di Udesk. Ia ahli dalam penerapan layanan pelanggan, mendukung merek manufaktur, ritel dan global untuk mengoptimalkan operasi dukungan serta CSAT.
Quality assurance call center sering gagal bukan karena perusahaan tidak punya form penilaian, tetapi karena orang yang berbeda membaca form itu dengan cara yang berbeda. Agen merasa nilainya tergantung siapa yang mendengarkan rekaman, sementara supervisor sulit menjelaskan kenapa satu percakapan mendapat 82 dan percakapan lain 90. Karena itu, sebelum menambah banyak indikator, lebih baik pastikan dulu standar penilaiannya memang bisa dipahami bersama.
Mulai dari percakapan yang benar-benar terjadi
Form QA sebaiknya tidak dibuat hanya dari SOP.
Ambil beberapa rekaman bagus, beberapa biasa saja, lalu beberapa yang pernah menimbulkan komplain. Dengarkan bagaimana agen benar-benar bekerja.
Dari situ biasanya terlihat bagian yang memang layak dinilai. Ada agen yang pembukaannya bagus, tetapi terlalu cepat memberi solusi tanpa memastikan masalah. Ada yang cukup empatik, tapi lupa melakukan verifikasi. Ada juga yang menyelesaikan kasus dengan benar, hanya saja prosesnya terlalu panjang.

Untuk banyak contact center, scorecard bisa dimulai dari tujuh bagian berikut.
| Area penilaian | Contoh yang diperiksa | Bobot contoh |
|---|---|---|
| Pembukaan | Salam, identifikasi agen, kesiapan membantu | 5% |
| Verifikasi | Identitas atau data pelanggan diperiksa sesuai aturan | 15% |
| Diagnosis | Agen memahami masalah sebelum memberi solusi | 15% |
| Solusi | Jawaban benar dan langkah yang diberikan bisa dijalankan | 25% |
| Kepatuhan | Script wajib, privasi, informasi sensitif, disclosure | 20% |
| Empati dan komunikasi | Nada bicara, mendengar, tidak memotong, bahasa jelas | 10% |
| Penutupan | Konfirmasi masalah selesai dan next step jelas | 10% |
Angka di atas hanya contoh, bukan bobot universal.
Contact center bank bisa memberi bobot jauh lebih tinggi pada verifikasi dan compliance. Tim layanan retail mungkin lebih menekankan akurasi solusi dan customer handling.
Yang penting, bobot mengikuti risiko bisnis.
Tidak semua kesalahan harus kehilangan poin dengan cara yang sama
Ini salah satu bagian yang sering membuat agen protes.
Misalnya agen lupa menyebut nama pelanggan sekali. Ia kehilangan dua poin. Agen lain tidak melakukan verifikasi identitas sebelum membuka data sensitif dan hanya kehilangan lima poin.
Secara matematika kelihatan konsisten. Secara risiko tidak.
Karena itu, beberapa item perlu diberi status critical.
Critical error biasanya dipakai untuk kejadian yang dampaknya besar, misalnya gagal melakukan verifikasi wajib, memberikan informasi yang tidak boleh dibagikan, membuat janji yang melanggar kebijakan, atau tidak mengikuti prosedur tertentu yang memang diwajibkan.
Tim bisa memutuskan bahwa satu critical error langsung membatasi skor maksimum atau membuat bagian compliance dianggap gagal.
Tidak perlu terlalu banyak item critical. Kalau setengah scorecard dianggap critical, istilah tersebut kehilangan arti.
Definisi tiap poin harus lebih jelas dari kata “baik”
Form QA sering memakai kalimat seperti “agen menunjukkan empati dengan baik”.
Masalahnya, “baik” bagi satu reviewer belum tentu sama dengan reviewer lain.
Lebih mudah kalau indikator ditulis dalam bentuk perilaku yang bisa didengar.
Misalnya, untuk diagnosis:
Agen merangkum masalah pelanggan sebelum memberi solusi ketika konteks belum jelas.
Untuk penutupan:
Agen memastikan apakah masih ada masalah lain sebelum mengakhiri panggilan.
Untuk empathy:
Agen mengakui ketidaknyamanan pelanggan ketika memang ada keterlambatan, kerusakan, atau kegagalan layanan.
Kalimat seperti ini belum sempurna, tetapi lebih mudah dipakai saat review daripada istilah abstrak seperti “excellent communication”.
Ukuran sampel jangan dianggap mewakili semuanya
Manual monitoring punya keterbatasan sederhana: orang hanya punya waktu sekian jam.
Kalau satu agen menangani 1.500 percakapan per bulan dan QA hanya mendengar tiga call, hasilnya tetap hanya menggambarkan tiga call.
Karena itu, sample sebaiknya jangan selalu random tanpa tujuan.
Sebagian bisa random. Sisanya bisa diambil dari area yang memang ingin dilihat, misalnya komplain, refund, eskalasi, pelanggan marah, atau call dengan durasi sangat panjang.
Kalau ada perubahan SOP minggu ini, sample juga bisa diarahkan ke percakapan yang memakai SOP tersebut.
Udesk sendiri mencatat bahwa manual QA sulit berkembang ketika volume interaksi besar karena tim hanya mampu meninjau sebagian kecil percakapan. Platform Udesk juga menyediakan quality inspection dan monitoring sebagai bagian dari lingkungan contact center-nya.
Blind review membantu melihat masalah penilai
Kalau memungkinkan, lakukan sebagian penilaian tanpa menunjukkan nama agen terlebih dahulu.
Bukan karena QA pasti bias. Tapi setelah mengenal agen tertentu selama bertahun-tahun, persepsi memang bisa terbawa.
Agen yang dikenal bagus mungkin mendapat benefit of the doubt. Agen yang sebelumnya sering salah bisa diperiksa terlalu ketat.
Blind review tidak perlu dipakai untuk semua call. Beberapa sample saja cukup untuk melihat apakah skor berubah ketika identitas agen disembunyikan.
Lebih menarik lagi kalau dua reviewer menilai call yang sama.
Kalau satu memberi 92 dan satu lagi 74, masalahnya belum tentu di agen. Bisa jadi scorecard memang belum cukup jelas.
Kalibrasi bukan rapat untuk mencari siapa yang benar
Sesi kalibrasi idealnya dilakukan secara rutin, misalnya mingguan atau dua mingguan untuk tim QA yang cukup aktif.
Ambil tiga sampai lima interaction yang sedikit ambigu.
Semua reviewer menilai sendiri dulu. Setelah itu baru bandingkan.
Jangan mulai dengan menunjukkan skor “resmi”, karena orang cenderung menyesuaikan penilaiannya setelah tahu angka acuan.
Diskusikan item yang berbeda jauh.
Misalnya satu reviewer menganggap agen sudah melakukan diagnosis karena bertanya satu kali. Reviewer lain merasa belum cukup karena agen langsung menyimpulkan penyebab.
Dari diskusi ini, scorecard bisa diperbaiki.
Kalibrasi yang bagus biasanya membuat definisi makin pendek dan jelas. Bukan malah menambah tiga halaman aturan baru.
Dispute perlu punya jalur yang normal
Agen sebaiknya boleh mempertanyakan hasil QA.
Bukan berarti semua skor bisa dinegosiasikan.
Buat proses yang sederhana. Agen atau supervisor mengajukan dispute dengan alasan spesifik, QA kedua melakukan review, lalu hasil akhirnya dicatat.
Jangan menerima dispute yang hanya mengatakan “saya tidak setuju”. Minta tunjukkan item mana yang dianggap keliru dan bagian call mana yang mendukung keberatan tersebut.
Data dispute juga berguna.
Kalau satu item terus-menerus diperdebatkan, mungkin masalahnya bukan agen terlalu defensif. Bisa jadi definisinya memang buruk.
Coaching jangan hanya bicara skor total
Nilai 86 tidak terlalu membantu agen kalau tidak tahu bagian mana yang harus diubah.
Lebih baik coaching melihat pola.
Misalnya dalam lima call terakhir, agen tiga kali gagal mengonfirmasi pemahaman masalah sebelum memberi solusi. Itu cukup spesifik untuk dilatih.
Atau skor empathy sebenarnya tinggi, tetapi compliance turun karena agen sering lupa verifikasi.
Jangan campurkan semua hal ke dalam satu sesi.
Pilih satu atau dua kebiasaan yang memang bisa diperbaiki minggu itu.
Monitoring call center akan terasa lebih adil kalau agen melihat hubungan antara call yang dinilai, kesalahan yang ditemukan, dan coaching yang diterima.
QA score jangan dibaca sendirian
Agen bisa mendapat QA score 95 tetapi CSAT-nya rendah.
Itu bukan berarti scorecard salah secara otomatis.
Bisa saja pelanggan tidak puas karena kebijakan perusahaan, bukan perilaku agen. Atau sebaliknya, agen sangat ramah sehingga CSAT tinggi, tetapi sebenarnya melewatkan langkah compliance.
Karena itu, lihat QA bersama metrik lain.
QA score membantu melihat kepatuhan terhadap standar internal. CSAT menunjukkan persepsi pelanggan. Repeat contact memberi petunjuk apakah solusi cukup tuntas. Complaint rate dan compliance incident menunjukkan risiko yang mungkin tidak terlihat dari rata-rata skor.
Kalau semuanya bergerak bersama, ceritanya lebih jelas.
Kalau berbeda, justru di situ perlu investigasi.
Contoh dashboard QA mingguan
Dashboard tidak perlu penuh grafik.
Cukup lihat beberapa angka yang memang bisa ditindaklanjuti.
| Metrik | Minggu ini | Yang perlu dicek |
|---|---|---|
| Rata-rata QA | 88 | Naik atau turun di area mana |
| Compliance score | 94 | Ada critical error atau tidak |
| Critical error | 7 kasus | Jenis pelanggaran paling sering |
| Calibration variance | 6 poin | Apakah reviewer sudah cukup selaras |
| Dispute rate | 9% | Item apa yang paling sering diprotes |
| Coaching completed | 82% | Apakah temuan QA sudah ditindaklanjuti |
| CSAT | 87% | Bergerak searah atau tidak dengan QA |
Angkanya hanya contoh.
Yang lebih penting adalah drill-down.
Kalau critical error naik dari dua menjadi tujuh, buka call-nya. Jangan menunggu akhir bulan.

Kasus China Customs cukup relevan untuk bagian quality inspection
Kasus resmi Udesk untuk China Customs menyebut bahwa organisasi tersebut menggunakan intelligent quality inspection berdasarkan kriteria yang sudah ditentukan, bersama dengan analisis data multi-channel untuk mendukung pengawasan layanan.
Kasus ini tidak menjelaskan scorecard manual, metode blind review, atau detail sesi kalibrasi mereka. Jadi tidak tepat kalau dipakai untuk menyimpulkan proses QA internalnya.
Tetapi ada satu hal yang relevan: quality inspection tetap membutuhkan kriteria yang ditentukan sebelumnya. AI bisa membantu memperluas monitoring, tetapi standar apa yang dianggap salah, kritis, atau perlu coaching tetap harus datang dari desain QA yang jelas.
AI bisa memperluas coverage, tapi manusia tetap perlu mengkalibrasi
Kalau volume call sudah besar, AI quality assurance bisa dipakai untuk memeriksa lebih banyak percakapan dan mencari pola yang sulit ditemukan dari sample manual. Udesk sendiri menyediakan quality inspection, monitoring, dan reporting dalam solusi call center, termasuk penggunaan AI untuk membantu penilaian percakapan dan konsistensi kualitas.
Tetapi jangan menganggap automation menghilangkan kebutuhan kalibrasi.
Kalau definisi “verifikasi lengkap” saja belum disepakati manusia, AI juga akan mengikuti aturan yang belum jelas.
Mulai dari scorecard yang cukup sederhana. Uji dengan beberapa reviewer. Lihat item yang sering berbeda. Perbaiki definisinya. Baru setelah itu perluas monitoring.
Untuk QA manager dan supervisor yang ingin menggabungkan rekaman, monitoring, quality inspection, reporting, serta coaching dalam lingkungan yang lebih terhubung, Udesk bisa dipertimbangkan sebagai platform pendukung. Nilainya bukan sekadar menilai lebih banyak call, tetapi membantu tim melihat pola kualitas secara lebih konsisten, menemukan percakapan berisiko lebih cepat, dan membawa hasil monitoring kembali ke proses evaluasi agen tanpa kehilangan peran manusia dalam kalibrasi dan keputusan akhir.
FAQ
Q:Apa yang sebaiknya ada dalam form quality assurance call center?
A:Minimal pembukaan, verifikasi, diagnosis, solusi, compliance, empati atau komunikasi, dan penutupan. Bobotnya perlu mengikuti risiko dan jenis layanan perusahaan.
Q:Berapa call yang perlu dinilai per agen?
A:Tidak ada angka yang selalu cocok. Tentukan berdasarkan volume, kapasitas QA, risiko, dan tujuan sampling. Untuk manual QA, kombinasikan random sample dengan call yang memang berisiko.
Q:Apa fungsi sesi kalibrasi QA?
A:Kalibrasi dipakai untuk memastikan beberapa reviewer membaca kriteria dengan cara yang relatif sama. Jika skornya jauh berbeda, definisi scorecard perlu diperiksa.
Sistem Call Center Udesk dengan konektivitas stabil dan fitur lengkap—coba gratis dan tingkatkan kualitas layanan telepon Anda.
Artikel ini merupakan karya asli Udesk. Jika akan diterbitkan ulang, wajib selalu mencantumkan sumber aslinya:https://id.udeskglobal.com/blog/quality-assurance-call-center-membuat-form-penilaian-dan-proses-kalibrasi
Call Center Cloudcall center Indonesiacall center software

Customer Service& Support Blog



