Pipeline panjang di Hermes punya musuh yang sering tidak terlihat: context window. Ketika agent bekerja dengan workflow yang melibatkan banyak step, tool calls, dan memory retrieval, context bisa meluap tanpa peringatan. Hasilnya? Pipeline collapse di tengah jalan, dan lo tidak tahu kenapa.

Banyak developer Hermes mengalami ini. Mereka membangun pipeline dengan 10-20 step, semuanya berjalan normal di awal. Tapi saat mencapai step ke-7 atau ke-8, agent tiba-tiba berhenti, mengembalikan error, atau mulai menghasilkan output yang tidak relevan. Masalahnya bukan di logic, bukan di tool definition, tapi di context window yang sudah penuh.

Artikel ini membahas teknik praktis manage context window di Hermes. Gua akan breakdown kenapa context collapse terjadi, strategi offload ke file versus hot memory versus session search, pattern STATE.md sebagai checkpoint, penggunaan skill sebagai context compression, dan tanda-tanda monitoring agar lo bisa mencegah crash sebelum terjadi.

Kenapa Context Window Collapse di Pipeline Panjang

Context window adalah ruang terbatas yang tersedia untuk menyimpan conversation history, tool results, dan state agent. Di Hermes, setiap step pipeline menambahkan entri ke context: prompt awal, hasil tool call, intermediate reasoning, dan output dari setiap agent. Ketika jumlah token mendekati batas maksimum, model mulai kehilangan informasi penting atau gagal merespons sama sekali.

Pipeline panjang memperparah masalah ini karena setiap step menambah beban context. Bayangkan lo punya workflow dengan 15 step. Setiap step memanggil tool, mendapatkan hasil, dan menyimpan state. Setelah step ke-10, context sudah berisi ratusan ribu token. Model tidak lagi punya ruang untuk reasoning yang mendalam, dan pipeline pun collapse.

Collapse bisa terjadi dalam beberapa bentuk. Pertama, hard crash: agent mengembalikan error karena context melebihi batas. Kedua, silent degradation: agent tetap berjalan tapi kualitas output menurun drastis, menghasilkan response yang tidak akurat atau tidak relevan. Ketiga, infinite loop: agent terjebak dalam siklus tool call berulang karena tidak bisa mengingat konteks sebelumnya dengan baik.

Pemahaman ini penting karena banyak developer menganggap collapse sebagai bug di logic pipeline. Padahal, masalahnya ada di manajemen context. Tanpa strategi yang tepat, pipeline panjang akan selalu rentan collapse, apapun kompleksitasnya.

Hermes menyediakan tiga mekanisme utama untuk mengelola context: file storage, hot memory, dan session search. Masing-masing punya trade-off yang perlu lo pertimbangkan berdasarkan use case.

File storage adalah strategi paling efektif untuk data yang besar tapi tidak perlu diakses setiap step. Lo bisa menulis hasil intermediate ke file, lalu membaca kembali saat dibutuhkan. Ini mengurangi beban context secara signifikan karena data tidak selalu berada di memori agent. Contoh praktis: ketika pipeline melakukan batch processing 1000 records, lo bisa menyimpan hasil setiap 100 records ke file, bukan menumpuk semua di context.

Hot memory cocok untuk state yang sering diakses tapi ukurannya relatif kecil. Memory ini tetap berada di context agent, jadi aksesnya cepat. Tapi lo harus selektif: hanya simpan informasi yang benar-benar dibutuhkan setiap step. Jika lo menyimpan semua hasil tool call ke hot memory, context akan cepat penuh. Pola ini erat berkaitan dengan sistem memory Hermes yang dibahas di artikel terpisah.

Session search memungkinkan agent mencari kembali informasi dari session sebelumnya tanpa harus menyimpan semuanya di context aktif. Ini seperti database mini yang bisa di-query kapan saja. Strategi ini bagus untuk workflow yang butuh referensi ke history panjang, tapi tidak semua data perlu aktif di context.

Kombinasi ketiga strategi ini adalah kunci. Gunakan file storage untuk data besar, hot memory untuk state kritis, dan session search untuk retrieval on-demand. Dengan pendekatan hybrid, lo bisa menjaga context tetap ringkas tanpa kehilangan akses ke informasi penting.

Pattern STATE.md sebagai Checkpoint

STATE.md adalah file markdown yang berfungsi sebagai checkpoint state pipeline. Setiap kali agent menyelesaikan step penting, lo bisa menulis ringkasan state ke file ini. Nantinya, agent bisa membaca STATE.md untuk memahami posisi workflow saat ini tanpa harus mengingat seluruh history dari awal.

Pattern ini efektif karena memisahkan context aktif dari state persistent. Context agent tetap bersih dan fokus pada step saat ini, sementara detail lengkap tersimpan di file. Ketika pipeline perlu melanjutkan dari checkpoint, agent cukup membaca STATE.md dan langsung memahami konteks yang dibutuhkan.

Implementasinya sederhana. Buat file STATE.md di direktori project, lalu tambahkan logic untuk update file setiap step kritis. Formatnya bisa berupa YAML atau markdown biasa, tergantung preferensi. Yang penting, setiap entri berisi informasi esensial: step yang baru diselesaikan, output kunci, dan state yang perlu dipertahankan untuk step berikutnya.

Contoh STATE.md:

## Checkpoint: Step 5 - Data Validation
- Timestamp: 2026-07-14T10:30:00Z
- Records processed: 450
- Errors found: 12
- Next action: Run cleanup script

Dengan pattern ini, lo tidak perlu menyimpan seluruh history validation ke context. Agent cukup membaca STATE.md dan melanjutkan workflow dengan informasi yang cukup.

Skill sebagai Context Compression: Encode Prosedur, Jangan Inline

Skill di Hermes bukan hanya tentang modularitas code, tapi juga tentang context compression. Ketika lo mengencode prosedur ke dalam skill, lo mengurangi jumlah token yang dibutuhkan untuk menjelaskan cara melakukan sesuatu. Skill menjadi representasi padat dari knowledge yang bisa di-reuse di berbagai step pipeline.

Contoh klasik: alih-alih menulis ulang prosedur autentikasi di setiap step yang membutuhkannya, lo membuat skill auth yang berisi semua logic terkait. Setiap kali step butuh autentikasi, agent cukup memanggil skill tersebut. Context yang dibutuhkan jauh lebih kecil karena prosedur sudah ter-encode dalam skill.

Ini berlaku untuk berbagai jenis prosedur: data transformation, API integration, error handling, dan lainnya. Setiap prosedur yang sering dipakai sebaiknya di-encode ke skill. Dengan begitu, context agent tetap ringkas dan pipeline bisa berjalan lebih panjang tanpa risiko collapse. Untuk panduan praktis menulis skill yang padat dan reusable, baca best practices authoring skill di Hermes.

Tapi ada satu hal yang perlu dihindari: jangan membuat skill yang terlalu besar. Skill yang berisi ratusan baris code justru bisa menjadi beban context sendiri. Pecah menjadi beberapa skill kecil yang fokus pada satu tugas. Prinsipnya: satu skill, satu prosedur, satu tujuan.

Monitoring: Tanda Context Window Mulai Penuh Sebelum Crash

Mencegah context collapse lebih mudah daripada menanganinya setelah terjadi. Hermes menyediakan beberapa tanda yang bisa lo gunakan untuk monitoring kesehatan context pipeline.

Tanda pertama adalah peningkatan latency. Ketika context mulai penuh, model membutuhkan waktu lebih lama untuk memproses setiap request. Jika lo melihat delay yang tidak wajar di step tertentu, itu bisa jadi sinyal bahwa context sudah mendekati batas.

Tanda kedua adalah penurunan kualitas output. Agent mulai menghasilkan response yang tidak relevan, mengulang informasi yang sudah ada, atau kehilangan konteks dari step sebelumnya. Ini adalah gejala silent degradation yang sering terlewatkan.

Tanda ketiga adalah error message yang menunjukkan context limit. Hermes biasanya mengembalikan error spesifik ketika context melebihi batas. Tapi lo tidak perlu menunggu error terjadi. Lo bisa menambahkan logic untuk menghitung estimasi token usage secara real-time dan memicu alert sebelum batas tercapai.

Untuk monitoring yang lebih baik, lo bisa menambahkan custom logger yang mencatat token usage setiap step. Dengan data ini, lo bisa mengidentifikasi pola dan mengoptimalkan pipeline sebelum collapse terjadi.

Insight: Context Management sebagai Inti Pipeline Stability

Manajemen context window bukan sekadar teknis optimization. Ini adalah fondasi dari pipeline stability di Hermes. Tanpa strategi yang tepat, pipeline panjang akan selalu rentan collapse, dan lo akan menghabiskan waktu untuk debugging yang sebenarnya tidak perlu.

Strategi yang efektif menggabungkan beberapa pendekatan: offload data berat ke file, pertahankan state kritis di hot memory, gunakan session search untuk retrieval on-demand, terapkan pattern STATE.md sebagai checkpoint, dan encode prosedur ke dalam skill. Kombinasi ini menjaga context tetap ringkas tanpa mengorbankan fungsionalitas.

Monitoring juga penting. Lo perlu tahu kapan context mulai penuh sebelum crash terjadi. Dengan tanda-tanda seperti peningkatan latency, penurunan kualitas output, dan estimasi token usage, lo bisa mengambil tindakan preventif.

Pada akhirnya, context management adalah tentang keseimbangan. Lo perlu menyimpan cukup informasi agar pipeline berjalan lancar, tapi tidak terlalu banyak hingga context penuh. Prinsip YAGNI berlaku di sini: hanya simpan apa yang benar-benar dibutuhkan, dan offload sisanya.

Pertanyaan Umum

Butuh Bantuan Implementasi?

Saya membantu founder dan tim membangun sistem operasi yang bisa jalan tanpa pengawasan konstan.

Hubungi Saya