Prefill dan Decode untuk Permintaan Serentak — Mengoptimumkan Prestasi LLM
Blog Hugging Face menerangkan pendekatan 'prefill' dan 'decode' untuk mengendalikan permintaan serentak kepada model besar bahasa (LLM). Teknik ini bertujuan mengurangkan latensi dan meningkatkan kecekapan inferens, terutamanya dalam beban permintaan tinggi.