← semua berita

Cara lebih baik menandai konten dengan LLM: biarkan berhalusinasi, lalu cocokkan

AI · · · sumber (simonwillison.net)

Doug Turnbull punya trik berlawanan intuisi untuk menandai konten dengan LLM, dan Simon Willison menilai trik ini layak disebarkan. Cara lazimnya adalah menyerahkan seluruh daftar tag yang diizinkan ke model, lalu meminta model memilih. Pendekatan ini rontok saat daftarnya besar: contoh furnitur milik Turnbull punya 1.856 kategori, dan blog Willison sendiri punya ribuan tag. Menjejalkan semuanya ke dalam prompt itu mahal, dan model tetap salah pilih.

Solusinya justru sebaliknya. Minta model mengarang tag secara bebas, disuruh membuat label yang benar-benar baru untuk item itu tanpa pernah melihat taksonomi Anda. Untuk "brown coffee table", model mungkin membayangkan hierarki rapi seperti Furniture / Living Room / Coffee Tables. Setelah itu, tag hasil halusinasi tadi dicocokkan ke kosakata asli Anda memakai vector embeddings, menempelkan tiap label karangan ke tag terdekat yang sudah ada. Model mengerjakan hal yang ia kuasai, yaitu menghasilkan tebakan yang lancar, sedangkan langkah embedding menangani bagian yang ia lemah, yaitu tetap berada dalam himpunan tetap.

Ini pengingat bagus bahwa halusinasi baru jadi masalah ketika keluarannya harus akurat. Di sini tebakan yang salah tapi masuk akal adalah bahan mentahnya, dan langkah kedua yang lebih murah yang membuatnya akurat.

Kenapa ini penting

Kalau Anda membangun sistem pencarian, penandaan, atau katalog, cara ini mengubah pola kegagalan umum jadi keunggulan. Berhenti membayar untuk menjejalkan daftar label raksasa ke tiap prompt, dan biarkan embeddings yang mencocokkan. Lebih murah dan biasanya lebih akurat.

LLMEngineeringEmbeddings