Dari Coding Agent ke Karyawan Digital: Aplikasi AI Menyatu dalam Satu Arsitektur Sistem
Dari Coding Agent ke Karyawan Digital: Penerapan AI Sedang Konvergen Menjadi Satu Arsitektur Sistem
Melihat beberapa stan produk Agent di Cloud Village Conference secara berurutan, temuan yang paling kontra-intuitif adalah: meskipun tampak berasal dari industri yang sepenuhnya berbeda, yang tumbuh justru merupakan satu OS yang sama.
Qoder mengerjakan pengembangan perangkat lunak, QwenWork mengerjakan pekerjaan pengetahuan, TinyFish mengerjakan Web Browser Agent, WonderClip mengerjakan produksi video, dan OpenSearch mengerjakan pencarian dan Research.
Jika kita menghilangkan konteks industri spesifiknya, struktur mendasar mereka sangat converges:
Konteks → Perencanaan → Keahlian → Eksekusi → Verifikasi → Memori → Hasil Bisnis
(Context → Planning → Skill → Execution → Verification → Memory → Business Outcome)
Inilah arsitektur sistem tunggal yang sedang dibentuk oleh produk-produk Agent.
⚠ Artikel ini menggunakan ekosistem Alibaba Cloud (Qoder/QwenWork/TinyFish/WonderClip/OpenSearch) sebagai sampel lapangan. Namun, penilaian arsitektur berikut ini juga berlaku untuk platform Agent di lingkungan build sendiri, Huawei Cloud, AWS, Azure, dan GCP—tujuh lapisan stack adalah konvergensi struktur rekayasa, bukan kesimpulan eksklusif dari satu cloud tertentu.

1. Inti Agent Sudah Bergeser dari “Mampu Menjawab” Menuju “Mampu Menjalankan Secara Berkelanjutan”
Di era Chatbot, siklus dasar sistem cukup sederhana: pengguna memberikan input, model memberikan output.
Di era Agent, tugas dapat berlangsung selama beberapa menit, jam, bahkan lebih lama. Agent perlu membaca file, menggunakan browser, memanggil API, menjalankan kode, menunggu tugas asinkron, memeriksa hasil, mencoba ulang saat gagal, dan menyimpan status.
Satu Prompt dan satu model tidak mampu menampung semua ini.
Sistem harus mulai memiliki Runtime.
慢慢学AI<043>: 从 QwenWork 与 Qoder 看 Agent 落地路径
Demonstrasi langsung Legal Document Fill Out oleh QwenWork sangat representatif: ia berjalan dalam Sandbox Container terisolasi, di mana Agent memiliki desktop virtual dan dapat memanggil perangkat lunak pemrosesan dokumen. Marketing Content Generation更进一步,叠加了 PPT、图片、Lip Sync、Python、Pillow、FFmpeg 等多种工具。
Lingkuangan eksekusi Agent semakin mendekati sebuah komputer terprogram——satu unit kerja yang dilindungi sandbox, mampu memanggil berbagai runtime dan perangkat, serta dapat mengeksekusi tugas secara berkelanjutan tanpa gangguan. Sandbox Container menyediakan isolasi, desktop virtual menyediakan kapabilitas operasi visual antarmuka grafis, dan pemanggilan tool memungkinkan model bertransisi dari “berbicara” menuju “bertindak”. Begitu kombinasi ini stabil, Agent benar-benar mulai menggantikan aspek operasional manusia, bukan sekadar menggantikan aspek berpikir manusia.
二、Qoder 的”One Foundation”是产品信号,不是口号
Papan eksposur Qoder menampilkan pernyataan berikut:
One workbench. Four entries. One foundation.
Terjemahan dalam Bahasa Indonesia:
Di atasnya terdapat Workbench, CLI, IDE, JetBrains Plugin, serta dapat diperluas dengan Cloud Agents dan Agent SDK.
Namun yang benar-benar layak diperhatikan adalah lapisan Foundation bersama di bawahnya.
Jika setiap jenis antarmuka mengimplementasikan Agent secara terpisah, sistem akan dengan cepat menjadi tidak terkendali. Pendekatan yang lebih rasional adalah menjadikan kemampuan seperti penjadwal tugas (task scheduler), hak akses, alat, Sandbox, Memory, Model Router, dan Verifikasi sebagai Harness bersama.
Setiap antarmuka hanya bertanggung jawab mengadaptasi kebutuhan pengguna dan skenario yang berbeda: CLI untuk programmer, IDE untuk pengembang, Workbench untuk peran non-teknis, JetBrains untuk skenario migrasi kode legacy, Cloud Agents untuk pemicu asinkron, dan Agent SDK untuk integrasi pihak ketiga. Sementara penjadwalan, memori, gateway alat, verifikasi, dan model keamanan berbagi fondasi yang sama.
Nilai dari复用ini lebih besar dari yang terlihat di permukaan. Dalam sebuah organisasi, pengalaman desain Sandbox, desain Permission, dan pengalaman Recovery dari Coding Agent dapat langsung dipindahkan ke Browser Agent, Content Agent, dan Ops Agent. Biaya paling mahal dari重复造轮子bukan biaya pengembangan, melainkan bencana tata kelola yang disebabkan oleh inkonsistensi performa antar Agent saat terjadi masalah—kode yang sama bisa diedit di IDE Agent dan juga di CLI Agent, namun Permission Model-nya berbeda, format log audit-nya berbeda, sehingga saat terjadi insiden tidak ada cara untuk menelusurinya.
三、Agent Stack通用 memiliki setidaknya七层—serta peta investasi “自建 / 共享 / 待验证” untuk setiap lapisannya
Setelah mengabstraksi konten dari beberapa diskusi tadi, saya membagi Agent Stack menjadi七层. Tabel di bawah ini juga menjawab pertanyaan paling praktis bagi sebuah organisasi:Lapis mana yang sebaiknya dibangun sendiri, lapis mana yang bisa langsung dishare dari open source atau dibeli, dan lapis mana yang masih perlu divalidasi.
Evaluasi Investasi AI (Observasi Lapangan 2026)
| Tingkat | Konten | Evaluasi Investasi (Observasi Lapangan 2026) |
|---|---|---|
| 1. Entry | Web / CLI / IDE / IM / API / GitHub Issue / Workbench Perusahaan | Adaptasi, jangan dibangun sendiri — Pilih format entry yang paling cocok untuk pengguna Anda |
| 2. Task | Goal / Spec / Context / Acceptance / Priority / Budget | Bangun sendiri, tapi tetap ringan — Task adalah kontrak, kalau dibuat jelek maka seluruh proses downstream akan berantakan |
| 3. Context & Memory | Pengetahuan enterprise, pengetahuan kode, tugas historis, keputusan, preferensi pengguna, status saat ini | Wajib bangun sendiri — Context adalah aset organisasi yang tidak bisa dibeli |
| 4. Planning & Skill | Pemecahan tugas, pemilihan Skill, pemilihan model, strategi paralel | Skill bangun sendiri, Planning boleh outsource — Skill adalah护城河 (moat kompetitif) |
| 5. Runtime & Tools | Shell / Browser / Computer Use / Filesystem / Git / Database / MCP / 企业 API | Semi-mandiri — Runtime umum bisa memanfaatkan stack open-source seperti Browser Use dan Anthropic Agent SDK; namun API gateway perusahaan harus dibangun sendiri |
| 6. Verification & Recovery | Testing, aturan проверка, evaluasi hasil, pemulihan gagal, retry dan rollback | Mandiri — Aturan verifikasi sangat terikat dengan bisnis, solusi bought-and-run tidak akan berfungsi |
| 7. Governance | Hak akses, Secrets, Audit, Cost, Policy, Human Approval | Wajib mandiri — Dan harus dirancang dari perspektif engineering, bukan compliance |
Berikut adalah satu kalimat untuk setiap keputusan kunci dari ketujuh lapisan:
Lapisan pertama — Entry. Web, CLI, IDE, IM, API, GitHub Issue, enterprise dashboard—semuanya hanyalah titik masuk tugas, tidak menghasilkan nilai bisnis dengan sendirinya.
Lapisan Kedua: Task。Goal, Spec, Context, Acceptance Criteria, Priority, dan Budget seharusnya merupakan bagian dari Task. Deskripsi Task yang合格 (memadai) seharusnya menjelaskan dengan jelas: tujuan, alasan melakukannya, kriteria kelulusan, prioritas, dan berapa anggaran yang tersedia. Jika sebuah sistem Agent bahkan tidak memiliki keenam字段 (elemen) ini, task akan mulai “melayang” tanpa arah di dalam sistem.
Lapisan Ketiga: Context & Memory。Pengetahuan enterprise, pengetahuan kode, task historis, keputusan, preferensi pengguna, dan status saat ini—semuanya tersimpan di lapisan ini. Yang ditekankan Qoder di tempat kejadian—Repo Wiki, Knowledge Graph, Knowledge Cards—adalah bentuk konkret dari lapisan ini: mengubah “fakta yang tersbar” menjadi “aset yang dapat dipanggil ulang oleh mesin”.
Lapisan Keempat: Planning & Skill。Di lapisan ini sistem memutuskan bagaimana cara membongkar task, memilih Skill mana yang bisa digunakan ulang, langkah mana yang membutuhkan model yang kuat, dan mana yang bisa dijalankan secara paralel. Lapisan ini adalah tempat Agent benar-benar mulai “berpikir”, dan juga area di mana kapabilitas model digunakan secara intensif.
Lapisan Kelima: Runtime & Tools. Shell, Browser, Computer Use, Filesystem, Git, Database, MCP, dan API perusahaan semuanya termasuk dalam lapisan ini. Ini adalah titik koneksi di mana Agent benar-benar bersentuhan dengan dunia luar.
Lapisan Keenam: Verification & Recovery. Testing, rule checking, evaluasi hasil, recovery dari kegagalan, retry, dan rollback.
Lapisan Ketujuh: Governance. Hak akses, Secrets, Audit, Cost, Policy, dan Human Approval.还包括更细的几项——算法备案、模型可解释性、出错归责、第三方依赖管控、数据出境管控——这是国内强监管行业(医疗、金融、交通、媒体、公共安全)上线 Agent 跑不掉的几道硬约束。
模型贯穿其中,但模型不再等于整个 Agent 平台。这是过去两年最被低估的认知迁移——很多团队花了太多时间比较模型,真正决定系统能否上生产的是后六层。
Empat、Browser Agent Menyempurnakan Interface antara Agent dan Dunia Nyata
Produk seperti TinyFish sangat representatif dalam hal ini.
Banyak sistem bisnis nyata tidak memiliki API yang baik, atau pengguna perlu login ke situs web, mengoperasikan halaman dinamis, mengisi formulir, berpindah halaman, dan mengunduh file. Automasi tradisional mengandalkan skrip Playwright atau Puppeteer, sehingga sekali halaman berubah maka skrip langsung tidak berlaku. Browser Agent memungkinkan model memahami halaman web secara langsung dan mengeksekusi aksi.
Kemampuan ini melengkapi celah penting dalam Agent Runtime: web yang nyata.
Sebuah agent pengajuan tautan eksternal, agent operasional, agent procurement, atau agent riset, semuanya mungkin perlu menyelesaikan aksi di dalam situs web.
Namun bagian yang benar-benar sulit di sini bukanlah “bisakah tombol ditekan”. Sistem produksi masih harus menyelesaikan masalah state login — bagaimana mengelola Cookie/Token, apa yang harus dilakukan saat kedaluwarsa; konkuren — bagaimana menyinkronkan beberapa tab yang beroperasi bersamaan dalam satu tugas; pemulihan kegagalan — bagaimana melanjutkan saat halaman crash atau koneksi terputus; pengiriman duplikat — bagaimana mencegah aksi klik dieksekusi berulang setelah fluktuasi jaringan; proxy — bagaimana menghindari限制地域/IP; CAPTCHA — bagaimana melewati identifikasi manusia-mesin; izin — bagaimana melakukan isolasi multi-akun; dan terakhir ada “membuktikan tugas benar-benar selesai” — bagaimana memverifikasi bahwa aksi benar-benar berlaku.
更深入一层, indirect prompt injection 是 Browser Agent 在 2026 年面临的最现实安全威胁:OWASP 将 prompt injection 列为 2026 年 AI 威胁第一位,只需在页面中嵌入一段隐藏文本就能诱导 Agent 将用户的 Cookie 发送出去。在架构层面没有完整解决方案,只能在 Sandbox、动作白名单、Ambient Credential 控制等方面进行工程上的权衡。
Browser Use 也必须被纳入 Harness。仅停留在 Demo 层的能力远远不够。如果一个组织真的要将 Browser Agent 应用于生产环境,光是这一层的成本就足以重新构建一套 RPA 系统。
因此,Browser Agent 看似应用,实际上是 Runtime 的一部分。
五、Verification 决定 Agent 能否获得更高权限
Agent 系统有一条非常直接的规律:自主性越高,验证和治理就必须越严格。
一个只能起草邮件的 Agent,出错成本有限。
一个可以修改生产数据库、提交代码、发送广告预算、操作企业后台的 Agent,其风险与前者完全不同。
一个真正成熟的 Agent 平台不能仅仅回答”能做什么”,还需要清晰地表达以下方面:
- 允许访问哪些内容;
- 允许修改哪些内容;
- 哪些操作必须经过审批;
- 每一步留下哪些审计记录;
- 失败后如何恢复;
- 系统如何证明任务确实已完成。
这里涉及一个工程化判断:如果一个 Agent 无法为其每一步操作提供可验证的证据,那么它的自主权就应该被限制在”建议者”的角色。换句话说,自主权是在合规框架内通过验证能力逐步放大的,而不是通过功能列表来解锁的。即使一个 Agent 在功能上能够调用 100 个 API,如果它无法证明每一次调用都达到了预期结果,那么在金融、医疗、跨境数据等强监管场景中,它仍然只能停留在”建议者”的角色。
这也解释了为什么 Governance 在企业场景中会变得越来越重要——它不仅仅是合规部门的职责,更是工程部门从一开始就必须与 Runtime 一起设计的能力。

VI. Model Router akan Menjadi Penjadwalan Dasar—Tapi Tidak Setiap Layer Perlu Model Termahal
Penggunaan multi-model semakin umum dilakukan.
Sistem multi-model yang berharga bukan sekadar memberikan pilihan GPT, Qwen, Claude, atau model lainnya kepada pengguna melalui dropdown.
Pendekatan yang lebih masuk akal adalah membiarkan sistem melakukan routing tugas secara otomatis.
Tugas perencanaan kompleks dan penilaian arsitektur ditangani oleh model yang kuat; implementasi kode rutin dan penyusunan teks ditangani oleh model yang lebih murah; tugas visual menggunakan model multimodal; klasifikasi massal menggunakan model cepat; review kritis kembali ke model yang kuat.
Di balik semua ini terdapat pertimbangan rekayasa yang sederhana: setiap tugas memiliki kurva “kemampuan-biaya” yang sepenuhnya berbeda terhadap model. Memaksa model yang kuat untuk melakukan klasifikasi massal adalah pemborosan; sementara model yang cepat menangani keputusan arsitektur akan menghasilkan rework berulang. Requesty pada 2026 pernah mempublikasikan data empiris: dengan merutekan 70% tugas rutin ke model nano, 20% ke mid-tier, dan 10% ke frontier, biaya per query rata-rata dapat diturunkan 60% hingga 80%, dengan kualitas yang hampir tidak menurun—ini adalah ilustrasi arah, angka spesifik bervariasi tergantung jenis tugas dan strategi routing.
Model secara bertahap berubah menjadi sumber daya komputasi yang dapat dijadwalkan. Agent Platform bertanggung jawab membuat pemilihan dinamis antara kualitas, kecepatan, biaya, dan risiko.
Contoh Praktik Routing Bertingkat
Ketika sebuah Agent menerima tugas “analisis strategi harga kompetitor dan berikan rekomendasi”, ia menggunakan model berdaya tinggi pada tahap memahami tugas, memecah langkah, dan menentukan prioritas. Kemudian, ketika harus mengklasifikasikan 100 SKU berdasarkan rentang harga, ia beralih ke model cepat. Setelah klasifikasi selesai dan perlu作出判断综合, agent切换回 model berdaya tinggi.
Jika semua任务 menggunakan model paling mahal, biaya sistem akan membengkak. Namun jika semuanya mengandalkan model murah, kegagalan akan terus terjadi pada节点 kompleks. Nilai rekayasa sejati datang dari strategi penjadwalan, bukan dari pemilihan model tertentu.
Tujuh、Skill——Lapisan Kunci yang Menjembatani Runtime Umum dan Bisnis Vertikal
sebuah Agent Runtime umum pada dasarnya tidak memiliki nilai bisnis. Ia baru bernilai ketika memasuki skenario nyata melalui Skill.
Coding Skill memahami cara membaca Repo, menulis Spec, menjalankan Test, dan menghasilkan PR. Skill ini menetapkan aturan: kapan wajib menjalankan unit test terlebih dahulu, kapan boleh dilewati, kolom apa saja yang harus ada dalam deskripsi PR, serta jenis perubahan apa yang mewajibkan human review.
SEO Research Skill memahami cara menemukan kata kunci, menganalisis search intent, memverifikasi intensitas kompetisi, menghasilkan kerangka konten, dan memastikan halaman telah terindeks. Ini bukan sekadar “melakukan riset kata kunci”, melainkan serangkaian alur kerja yang lengkap.
E-commerce Creative Skill mengetahui Brand, SKU, format platform, kepatuhan (compliance), dan proses review. Skill ini harus memahami batasan ukuran gambar untuk setiap platform, kata-kata terlarang, kualifikasi kategori, serta proses review terakhir sebelum penempatan iklan.
Ops Skill mengetahui cara mengakses monitoring, log, container, database, dan mekanisme rollback. Skill ini harus dapat membedakan alert mana yang bisa ditangani secara otomatis dan mana yang memerlukan intervensi manual, serta apa yang dimaksud dengan titik rollback yang aman.
Skill bukan sekadar SOP, melainkan sebuah aset yang dapat dieksekusi dengan version control, manajemen dependensi, manajemen iterasi, dan fallback ketika gagal. Dengan merujuk pada protokol Skills yang diluncurkan Anthropic pada Oktober 2025, setiap pengalaman domain dapat dikemas ke dalam folder SKILL.md, memungkinkan berbagai platform Agent untuk memuat sesuai kebutuhan, daripada menulis ulang dari awal setiap kali.
Skill menjembatani kemampuan eksekusi umum dengan pengetahuan domain.
Karenanya, competitive advantage banyak aplikasi AI di masa depan akan terletak pada Domain Skills yang telah divalidasi melalui banyak tugas nyata. Skills ini mengakumulasi pengetahuan tentang “bagaimana melakukan sesuatu di bidang ini”—tidak mudah ditimpa oleh model baru, tidak mudah digantikan oleh platform baru, tetapi justru akan menghasilkan compounding benefit seiring waktu.
Delapan、Perspektif Industri: Empat Jenis Organisasi dalam Implementasi Nyata
Empat bagian berikut bukanlah narasi, melainkan pemetaan “tujuh lapisan Stack” abstrak ke industri spesifik, menunjukkan di mana letak titik-titik tersendat (pain points) yang berbeda antar industri.
Telekomunikasi/Operator: Perubahan paket layanan, aktivasi专线 (dedicated line) untuk segmen enterprise dan pemerintahan, serta lokalisasi fault lintas domain—semuanya ini harus menembus berbagai domain seperti BSS, OSS, CRM, dan sistem billing. Tantangan terbesar dalam implementasi Agent adalah rekonsiliasi lintas domain — ketika sebuah Agent mengubah paket layanan pengguna di CRM, sistem harus secara sinkron memberitahu domain billing dan OSS; jika tidak, maka settlement period akan menjadi tidak konsisten. Di dalam Stack, lapisan yang paling bernilai adalah Lapisan ke-5 Runtime & Tools (yang mengintegrasikan antarmuka antar domain) ditambah Lapisan ke-7 Governance (audit账务 / audit keuangan).
Perbankan/Keuangan: Manajemen risiko, pencegahan pencucian uang, rekonsiliasi, dan pelaporan regulasi—semua menuntut kemampuan dijelaskan, diaudit, dan dilacak. Sebuah Agent anti-pencucian uang harus bisa menjelaskan untuk setiap keputusan “mempertahankan” atau “memblokir” transaksi,规则 mana yang digunakan, riwayat transaksi apa yang dijadikan dasar, dan data pelanggan mana yang dirujuk. Di Stack, lapisan paling bernilai adalah Lapisan ke-6 Verification (rantai bukti yang dapat dijelaskan) dan Lapisan ke-7 Governance (pendaftaran algoritma + kontrol lintas batas data)—dua lapisan ini merupakan prasyarat mutlak untuk上线 di bawah kerangka regulasi keuangan domestik, bukan sekadar nilai tambah opsional.
Manufaktur: Sistem MES, ERP, QMS, dan SRM selama ini terisolasi satu sama lain; pengambilan keputusan lintas domain (misalnya, “apakah perlu追加 pemesanan material ketika kapasitas produksi不足”) harus bolak-balik di antara empat sistem tersebut. Bentuk nyata Agent di manufaktur adalah lapisan orkestrasi lintas sistem, bukan pengganti sistem individual. Agent membaca data material dari ERP, tingkat kecacatan dari QMS, utilisasi kapasitas dari MES, dan kinerja pemasok dari SRM secara bersamaan, lalu memberikan keputusan komprehensif. Di Stack, lapisan paling bernilai adalah Lapisan ke-5 Runtime (gerbang API perusahaan) dan Lapisan ke-3 Context (akumulasi pengetahuan proses, riwayat kegagalan, dan pengalaman lantai produksi).
E-commerce: Aktivitas promosi lintas domain (pemesanan, pembayaran, inventaris, logistik, layanan pelanggan), stress testing/konsistensi inventaris/pencegahan pembobolan promo/penyelesaian rekening lintas platform. Agent最先落地的是operasi kreatif(mengganti gambar produk, mengganti latar belakang, menyediakan materi multibahasa)和dukungan asisten layanan pelanggan。Di tingkat Stack, yang paling bernilai adalah Skill di lapisan ke-4 (proses kepatuhan dan audit untuk SKU/kanal di setiap platform) dan Verification di lapisan ke-6 (pemeriksaan otomatis apakah materi memenuhi spesifikasi platform).
Kesamaan dari empat jenis organisasi: Semakin ke bawah di Stack, semakin layak untuk di-share; semakin ke atas, semakin layak untuk dibangun sendiri. Kemampuan dasar seperti Runtime, Model Router, Tool Gateway lebih hemat jika dibangun bersama atau membeli stack open source yang sudah matang; Skill, Context, Governance harus dibangun sendiri karena melekat pada bisnis, kepatuhan, dan aset organisasi.
9. Produk Akhir Mungkin Terlihat Sangat Berbeda, Tapi OS Dasarnya Sama
UI, pengguna, dan model bisnis dari Coding Agent dan Video Agent sama sekali berbeda.
Tapi di level dasar, semua butuh: Context, Task, Skill, Tools, Runtime, Verification, Memory, Governance—akhirnya semua harus menghasilkan hasil bisnis.
Satu Knowledge Agent perusahaan dan satu Browser Agent mungkin tampak sangat berbeda, namun keduanya pada akhirnya harus menyelesaikan masalah yang sama: permission, status, failure recovery, dan audit.
Karena itu, ketika mengembangkan beberapa produk AI di masa depan, ada baiknya membedakan dua lapisan.
Lapisan atas dikelola secara vertikal. Setiap produk berfokus pada satu Job yang lengkap, dengan pengalaman pengguna, objek data, dan metrik bisnis sendiri. Untuk Coding Agent, objeknya adalah Repo dan Code Review; untuk Video Agent, objeknya adalah Script dan Asset; untuk Research Agent, objeknya adalah Source dan Citation. Kedalaman vertikal masing-masing tidak dapat digantikan oleh kemampuan通用 (general-purpose).
Lapisan bawah disharing semaksimal mungkin. Agent Runtime, Model Router, Tool Gateway, Memory, Audit, Secrets, dan Evaluation dapat menjadi infrastruktur通用 yang dapat digunakan bersama.
Pendekatan ini tidak hanya menghindari setiap produk membuat ulang roda dari nol, tetapi juga menghindari kesalahan membangun platform “Agent万能 (general-purpose)” yang besar sejak awal namun tanpa pengguna—masalah yang dialami banyak tim dalam dua tahun terakhir, di mana mereka mencoba menyelesaikan semua skenario sekaligus, yang berujung pada tidak satupun skenario yang mencapai kedalaman yang dapat digunakan.
Jalur yang lebih stabil adalah membuktikan nilai dari tugas-tugas konkret terlebih dahulu, baru kemudian mengekstrak kemampuan dasar yang muncul berulang kali. Dasar pertimbangannya:Lapisan umum hanya bisa tumbuh dari skenario spesifik, bukan dari diagram arsitektur. Merancang Runtime yang “mendukung semua skenario” sejak awal biasanya berarti tidak ada skenario pun yang ditangani dengan baik.
Tiga pertanyaan self-review terbalik (gunakan setelah menulis untuk memeriksa diri sendiri):
- Apakah Runtime yang kita abstraksi sudah diverifikasi universalitasnya di minimal dua skenario konkret?
- Apakah setiap desain lapisan kita sudah terhubung dengan masalah bisnis spesifik yang benar-benar pernah出错?
- Jika hari ini anggaran dipotong setengah, lapisan mana yang akan kita pertahankan? Jika jawabannya adalah “context dan skill”, arahnya benar; jika “runtime dan gateway”, mungkin perlu dirombak total.
Ini juga留下给我的一个长期判断 dari CloudTown Conference(Konferensi Yunqi): di atas model sedang tumbuh satu lapisan sistem baru, yang bukan eksklusif untuk produk tertentu, tetapi perlahan berubah menjadi OS di era Agent. Siapa yang pertama kali mengendapkan lapisan OS ini dengan solid, akan lebih mungkin mengantongi红利 di iterasi produk berikutnya.
Implications untuk Pengambil Keputusan
Jika Anda adalah orang nomor satu AI di perusahaan dengan pendapatan tahunan di atas 5 miliar (CDO/CIO/CTO), ada tiga hal yang bisa dimulai sekarang:
Pelajaran AI Pelan-pelan<001>
Langkah Praktis Mengadopsi AI Agent: Tiga Poin Kunci untukCIO
1. Buat Snapshot Tujuh Lapisan Agent Stack Organisasi Anda Saat Ini
Jangan terburu-buru membeli produk. Pertama, pahami kondisi setiap lapisan yang Anda miliki saat ini — apakah masih kosong, sudah menggunakan solusi pihak ketiga, atau masih setengah jadi. Gambaran ini akan langsung menunjukkan di mana bottleneck sebenarnya berada.
2. Pilih 1 Skenario dengan ROI Tinggi, Selesaikan Satu Siklus Vertikal Secara Utuh
Jangan mulai dengan membangun Runtime. Pilih salah satu dari Coding Agent, asisten pelanggan, atau asisten riset dan pengembangan. Jalankan keempat lapisan — Context, Task, Skill, dan Verification — hingga selesai dan terintegrasi dengan baik, baru kemudian bicara tentang “membangun platform”.
3. Angkat Governance ke Level Teknis, Jangan Simpan di Level Kepatuhan
Izin akses, audit, explainability, penentuan tanggung jawab saat terjadi kesalahan, serta pengelolaan dependensi pihak ketiga — semua ini harus dirancang bersamaan dengan Agent bisnis sejak awal, bukan ditambahkan kemudian sebagai tambalan kepatuhan.
Pertanyaan Umum
Q1: Apa Perbedaan Tujuh Lapisan Stack Ini dengan Framework Multi-Agent Orchestration dari Gartner dan IDC?
Gartner dan IDC fokus pada koordinasi dan tata kelola multi-Agent di tingkat organisasi. Ketujuh lapisan dalam artikel ini menggambarkan struktur teknis internal dari satu Agent secara individual. Sebuah organisasi bisa membahas keduanya secara bersamaan — satu Agent mengikuti ketujuh lapisan, sementara interaksi antar-Agent dikelola melalui orchestration. Stack bersifat mikro, orchestration bersifat makro.
Q2: Mengapa lapisan model tidak berdiri sendiri sebagai satu lapisan?
Karena model dalam sistem Agent adalah sumber daya yang melintasi secara horizontal, bukan lapisan eksklusif. Model Router memperlakukan berbagai model sebagai alokasi komputasi yang berbeda, setara dengan Shell atau Browser di Runtime — sekadar “alat” dengan status yang sama. Model memang krusial, tapi ia tidak bisa mendominasi kompleksitas Agent.
Q3: Apakah tim kecil sebaiknya melewati lapisan ini dan langsung menggunakan produk end-to-end seperti ChatGPT atau Claude?
Jawabannya ya. Untuk organisasi dengan pendapatan tahunan di bawah 100 juta yuan dan kompleksitas rendah, menggunakan produk Agent jadi-jadi (seperti Browser Use, Manus, atau Alibaba Cloud Bailian Agent) jauh lebih efisien. Ketujuh lapisan yang dibahas dalam artikel ini berangkat dari pertanyaan: “Apakah organisasi dengan pendapatan tahunan 50 miliar yuan atau lebih perlu membangun platform Agent sendiri?” Membangun platform untuk tim kecil justru merupakan optimasi terbalik.
Kontra-Diagnosis (Untuk Anda, Juga Untuk Saya)
Tiga pernyataan berikut — jika ada satu saja yang membuat Anda mengangguk dalam hati, itu pertanda Anda mungkin sedang terbawa narasi, bukan mengikuti bukti.
- “Asalkan modelnya cukup kuat, Agent akan bekerja sendiri.” (Model adalah syarat notwendig, bukan cukup. Enam lapisan terakhir menentukan apakah bisa masuk ke produksi.)
- “Kita butuh platform Agent serbaguna.” (Biaya pemikiran ini kemungkinan besar akan melebihi nilai bisnis yang bisa dihasilkan dalam 6 bulan.)
- “Skill bisa menunggu sampai model stabil baru di-endapkan.” (Skill adalah aset organisasi; satu hari lebih lambat di-endapkan, satu hari lebih lambat mendapat efek bunga berbunga.)
Jika ketiga poin di atas tidak ada yang mengangguk, lanjutkan membaca.
Catatan Referensi Akhir Artikel (Sumber Per條 + Tingkat Bukti + Label Posisi)
Catatan: Bagian ini menyediakan referensi lengkap untuk setiap klaim dalam artikel.
“One workbench. Four entries. One foundation.” ——Papan presentasi dan blog resmi Qoder, Cloud Village Conference 2026 + artikel Introducing Qoder 1.0 yang dipublikasikan di Alibaba Cloud Community pada 2026-08-31. Tingkat bukti: Klaim vendor (Posisi Alibaba).
QwenWork Legal Document Fill Out: Sandbox Container + Desktop Virtual + Pemanggilan Tool ——Demo langsung QwenWork Alibaba Cloud, artikel di Alibaba Cloud Community 2026-09-25. Tingkat bukti: Klaim vendor (Posisi Alibaba).
QoderWake sebagai produk “Digital Employee”, dirilis oleh Alibaba pada 2026-04-30 ——Entri Qoder di Baidu Encyclopedia + resmi dari Alibaba. Tingkat bukti: Klaim vendor (Posisi Alibaba).
OWASP 2026 Threat List Menempatkan Prompt Injection di Peringkat Pertama — Ringkasan State of Browser Use, Mei 2026 (Michael Livs blog). Tingkat Bukti: Sintesis Pihak Ketiga (Posisi OWASP, konsensus industri).
Requesty: Alokasi Bertingkat 70/20/10 Dapat Mengurangi Biaya 60-80% — Blog Resmi Requesty, 2026. Tingkat Bukti: Klaim Vendor (Sudut pandang penyedia layanan routing model, angka cenderung optimistis, hanya sebagai indikasi arah).
Microsoft Agent Governance Toolkit (AGT), 2026-04-02 Dirilis sebagai Open Source dengan Lisensi MIT — Liputan niteagent.com. Tingkat Bukti: Sintesis Pihak Ketiga (Posisi Microsoft, namun AGT adalah proyek open source dengan data yang dapat diverifikasi).
Protokol Anthropic Skills: dirilis 2025-10-16, di-open source sebagai standar terbuka pada 2025-12-18 — Blog Anthropic Engineering + ringkasan Substack + Medium LM Po. Tingkat bukti: Klaim vendor + ringkasan pihak ketiga (posisi Anthropic).
IDC memprediksi 40% produsen akan mengadopsi penjadwalan berbasis AI pada 2026 — Ringkasan Groovy Web 2026, mengutip laporan IDC. Tingkat bukti: Ringkasan pihak ketiga (posisi IDC, angka sebagai referensi arah).
Stripe “Minions” menggabungkan 1.300+ PR per minggu, 0 orang menulis kode, seluruh review manual — Tim engineering Stripe Steve Kaliski dalam acara How I AI pada 2026-03-25 + ByteMonk pada 2026-02-14. Tingkat bukti: Klaim vendor (posisi Stripe, angka sebagai referensi, skenario adalah internal engineering Stripe, tidak dapat digeneralisasi ke rata-rata industri).
BCG 2026 Applied AI Index: agentic menyumbang 22% dari total nilai AI (2026) → 39% (2030) ——Laporan publik yang dirilis oleh BCG. Tingkat bukti: komprehensif pihak ketiga (perspektif konsultan, referensi direksional angka).
Gartner memperkirakan 40% aplikasi enterprise akan mengintegrasikan AI Agent berbasis tugas pada 2026, dibandingkan <5% pada 2025 ——Ringkasan Paul Okhrem 2026, mengutip Gartner. Tingkat bukti: komprehensif pihak ketiga (perspektif Gartner, referensi direksional).
CAC/NDRC/MIIT Tiongkok bersama-sama menerbitkan “Pendapat Implementasi tentang Standardisasi Aplikasi dan Pengembangan Inovasi Intelligent Agent”, berlaku per 2026-07-15 ——Buletin regulasi AI Tiongkok bulanan Rimon Law, Juli 2026. Tingkat bukti: komprehensif pihak ketiga (perspektif lembaga hukum, dokumen regulasi dapat diverifikasi).
TinyFish: mengumpulkan dana $47M, klien mencakup Google/DoorDash/Amazon, cold start browser <250ms ——Ikhtisar SwitchTools 2026. Tingkat bukti: komprehensif pihak ketiga (posisi situs review produk, angka perlu diverifikasi dengan TinyFish resmi).
Jika Anda sedang mengevaluasi cara membangun platform Agent internal perusahaan, kapabilitas mana yang seharusnya dibangun sendiri / dibeli / dibagi, serta Agent Runtime mana yang memiliki nilai penggunaan ulang tertinggi, jangan ragu untuk berdiskusi dengan kami. Kami menyediakan konsultasi khusus transformasi AI perusahaan——mulai dari arsitektur Agent, desain Runtime, hingga akumulasi Skill, membantu Anda mengubah “Agent single-point” menjadi “platform Agent tingkat organisasi”.
慢慢学AI<07>——AI 转型七步框架:从战略到落地的实战指南
面向四大行业的 AI 转型路线图
电信运营商 | 银行与金融服务 | 制造业 | 电商平台
第一阶段:战略共识与顶层设计
1.1 业务目标对齐
AI 转型不是技术部门的独角戏,必须从业务痛点出发。电信运营商聚焦网络优化与客户体验提升;银行侧重风险控制与个性化服务;制造关注生产效率与质量追溯;电商追求转化率优化与供应链柔性。
1.2 变革治理架构
建议设立三层治理体系:
- 战略层:CEO + C级高管组成决策委员会
- 执行层:CTO / CIO 牵头项目经理组
- 运营层:各业务线 AI 专员
第二阶段:技术栈规划与选型
2.1 Agent Stack 七层模型
1 | ┌─────────────────────────────────────┐ |
2.2 自建 vs 外采决策矩阵
| 评估维度 | 自建优势 | 外采优势 |
|---|---|---|
| 数据安全 | 数据不出域 | 依赖厂商合规 |
| 定制深度 | 完全可控 | 能力受限 |
| 成本结构 | 前期高、边际低 | 按需付费 |
| 时间周期 | 6-12个月 | 即时可用 |
第三阶段:数据基础设施
3.1 数据治理四大支柱
- 数据质量:清洗 → 标注 → 验证闭环
- 数据安全:分级分类 + 脱敏规则
- 数据合规:满足《网络安全法》《数据安全法》要求
- 数据资产化:构建企业知识图谱
第四阶段:PoC 到规模化
4.1 分阶段验证路径
1 | PoC (3个月) → Pilot (6个月) → Scale (12个月+) |
4.2 成功案例参考
案例:某省电信运营商
- 场景:客服热线智能分流
- 技术方案:CoT Prompt + RAG + Function Calling
- 成效:人工介入率降低 40%,单次服务时长缩短 35%
第五阶段:组织能力建设
5.1 人才梯队培养
- AI Literacy:全员工普及(建议使用通义灵码/Qoder 等工具)
- Prompt Engineering:业务骨干专项
- Agent 开发:技术团队深度培训
5.2 Skill 沉淀方法论
建立企业内部的知识共享机制:
- 案例库:沉淀成功与失败经验
- Prompt 模板库:可复用的提示词资产
- 工具链文档:操作手册与最佳实践
第六阶段:合规与安全保障
6.1 中国监管框架
| 法规 | 核心要求 | 适用场景 |
|---|---|---|
| 《网络安全法》 | 网络安全等级保护 | 基础合规门槛 |
| 《数据安全法》 | 数据分类分级 | 数据全生命周期 |
| 算法备案 | 算法透明度披露 | 推荐/风控系统 |
| 数据出境评估 | 数据跨境传输 | 海外业务/IPO |
6.2 跨境数据传输
- 境内存储:核心数据不出域
- 脱敏处理:可出境数据需满足最低泄露风险阈值
- 安全评估:通过网信部门认证的出境评估
第七阶段:持续运营与迭代
7.1 运营监控体系
- 效果指标:任务完成率、用户满意度、ROI
- 安全指标:数据泄露事件、合规审计通过率
- 效率指标:Token 消耗成本、响应延迟
7.2 迭代优化机制
建议采用双周敏捷迭代,每两周进行一次效果复盘与策略调整。
附录:术语表
| 术语 | 定义 |
|---|---|
| Agent | 具备自主决策能力的 AI 智能体 |
| Token | 模型处理的最小文本单位 |
| CoT (Chain of Thought) | 思维链推理技术 |
| RAG (Retrieval-Augmented Generation) | 检索增强生成 |
| Function Calling | 函数调用能力 |
| Prompt Engineering | 提示词工程 |
服务与资源
- 企业内训:面向管理层与业务骨干,3 天通识课,把 Agent Stack 七层、Governance 工程视角、Skill 沉淀方法论拆给你团队。
- 专项咨询:90 分钟架构诊断,针对你组织当前的七层快照、空缺层、外采 vs 自建判断给出一份独立评估;深度陪跑按项目报价。
- 管理层分享与行业演讲:行业大会 / 闭门会 / 论坛主题分享,联系后定制议程。
合作邮箱:[email protected]
延伸阅读:《AI 转型七步框架》,系统讲清楚企业落地 AI 的完整路径。
本地化要点(多语言翻译对照,IAIUSE 多语言策略·2026-08-09 约定)
翻译 19 语时,下述内容按目标语言市场本地化替换,结构/视觉不变:
| 中文稿内容 | Indonesian版 |
|---|---|
| Qoder / QwenWork / TinyFish / WonderClip / OpenSearch | Qoder / QwenWork / TinyFish / WonderClip / OpenSearch (pertahankan nama produk) |
| Alibaba Cloud / 钉钉 / 飞书 | Alibaba Cloud / AWS / GCP / Azure / Slack / Teams | アリババクラウド / AWS / GCP / Azure / Slack / Teams / Lark | Alibaba Cloud / AWS / GCP / Azure / Slack / Teams | Alibaba Cloud / AWS / Slack / Teams |
| 中国电信/移动/联通 (skenario deployment Agent enterprise) | AT&T / Verizon / T-Mobile | NTT / KDDI / SoftBank | Deutsche Telekom / Vodafone | STC / Etisalat |
| Perusahaan manufaktur Tiongkok yang mewakili (kasus ERP/MES/QMS/SRM) | GE / Honeywell / Rockwell | Toyota / Hitachi / NTT Data | Siemens / Bosch / SAP | SABIC / Aramco / STC |
| Bank of China (studi kasus keuangan) | JPMorgan / Goldman Sachs | Mitsubishi UFJ / SMFG | Deutsche Bank / Commerzbank | Emirates NBD / QNB |
|---|---|---|---|---|
| Wadah Sandbox / Desktop Virtual / Pemanggilan Alat | Sandbox Container / Virtual Desktop / Tool Calling | Wadah Sandbox / Desktop Virtual / Pemanggilan Alat | Wadah Sandbox / Desktop Virtual / Pemanggilan Alat | Wadah Sandbox / Desktop Virtual / Pemanggilan Alat |
| One Foundation / Harness | One Foundation / Harness | One Foundation / Harness | One Foundation / Harness | One Foundation / Harness |
#慢慢学AI:Browser Agent
| Browser Agent(浏览器智能体) | Browser Agent(保留) | ブラウザエージェント | Browser-Agent | وكيل المتصفح |
|---|---|---|---|---|
| Agen Browser | Agen Browser | Agen Browser | Agen Browser | Agen Browser |
Browser Agent atau agen berbasis browser adalah sistem AI yang mampu berinteraksi langsung dengan antarmuka web, mengeksekusi tugas seperti navigasi, pengumpulan data, dan operasi klik secara otomatis. Berbeda dengan model bahasa tradisional yang hanya menghasilkan teks, Browser Agent dilengkapi kemampuan untuk “melihat” dan “mengoperasikan” halaman web, menjadikannya komponen kunci dalam transformasi digital enterprise saat ini.
| Domain Skill / Coding Skill / SEO Research Skill / E-commerce Creative Skill / Ops Skill | Domain Skill(保留)/ Coding Skill / SEO Research Skill / E-commerce Creative Skill / Ops Skill | ドメインスキル / コーディングスキル / SEO リサーチスキル / Eコマースクリエイティブスキル / Ops スキル | Domain-Skill / Coding-Skill / SEO-Research-Skill / E-Commerce-Creative-Skill / Ops-Skill | مهارة المجال / مهارة البرمجة / مهارة بحث السيو / مهارة إبداع التجارة الإلكترونية / مهارة العمليات | Keterampilan Domain / Keterampilan Coding / Keterampilan Riset SEO / Keterampilan Kreatif E-commerce / Keterampilan Operasional |
|---|
Terminologi Model Router (Model Router)
| Model Router | Model Router (Pertahankan) | Model Router | Model-Router | Muat data ke dalam Model (Penghubung) |
| Verifikasi & Pemulihan / Tata Kelola | Verifikasi & Pemulihan / Tata Kelola (Pertahankan) | Verifikasi dan Pemulihan / Tata Kelola | Verifikasi & Wiederherstellung / Governance | Verifikasi dan Pemulihan / Tata Kelola |
| Pendaftaran Algoritma / Transfer Data Lintas Batas | Pendaftaran Algoritma / Transfer Data Lintas Batas (Pertahankan) | Pendaftaran Algoritma / Transfer Data越过 Batas | Algorithmus-Registrierung / grenzüberschreitende Datenübertragung | Pendaftaran Algoritma / Pemindahan Data Lintas Batas |
Catatan Terminologi
Model Router: Merujuk pada komponen arsitektur yang mengelola routing dan distribusi permintaan antar model AI dalam sistem enterprise.
Verifikasi & Pemulihan: Mekanisme untuk memastikan integritas output model dan kemampuan recovery dari kegagalan sistem.
Tata Kelola: Kerangka kerja untuk oversight, kepatuhan regulasi, dan manajemen risiko dalam implementasi AI.
Pendaftaran Algoritma: Persyaratan kepatuhan regulasi yang mengharuskan pendaftaran sistem algorithm/AI kepada otoritas pengawas (di Tiongkok dikenal sebagai “算法备案”).
Transfer Data Lintas Batas: Perpindahan data pribadi atau sensitif lintas yurisdiksi, yang tunduk pada regulasi seperti GDPR (Uni Eropa), PIPL (Tiongkok), atau undang-undang perlindungan data setempat.
Tentang Seri Ini
“Cloud Village Observation” adalah seri lap diskusi industri yang diluncurkan oleh IAIUSE, dimulai dari Cloud Village Conference 2026, mengupas perubahan nyata yang sedang terjadi di industri AI dari perspektif seorang peneliti—bukan mengejar berita terkini, melainkan hanya melihat arah yang sedang dipertaruhkan dan kekuatan buktinya.
Seri ini mencakup lapisan sistem di atas model, implementasi Agent, aset Context, desain organisasi AI perusahaan, migrasi unit kompetitif produk AI, dan topik lainnya, dengan total sekitar 10 artikel.
Saya memiliki pengalaman hampir 8 tahun dalam konsultasi perusahaan besar dan analisis bisnis, pernah bekerja di IBM dan terlibat dalam proyek-proyek yang berkaitan dengan telekomunikasi, keuangan, Perbankan, dan manufaktur. Setelah itu, saya melanjutkan karier di lini terdepan produk operator, produk internet, dan pengembangan aplikasi AI, dengan fokus pada analisis kebutuhan, desain produk, dan implementasi lintas tim.
Akun ini sebenarnya didukung oleh tim kecil—saya dan 1-2 kolega yang sudah lama bekerja sama, masing-masing bertanggung jawab atas area yang berbeda seperti riset alat pemrograman AI, pengumpulan kasus治理 organisasi, serta sesi coaching. Sebagian besar proyek yang kami sebutkan dalam artikel adalah hasil kerja sama kami bersama dalam penyelesaiannya.
Pustaka riset kami telah mengumpulkan lebih dari 200 artikel. Kesimpulan dalam seri ini didasarkan pada observasi lapangan dan validasi silang antarindustri secara langsung, dengan perspektif автор yang jelas, serta tidak mewakili pandangan vendor mana pun.





