Infrastruktur Digio

Model AI & GPU

Jalankan ejen pada model sempadan terurus hari ini—atau sewa kapasiti GPU, gunakan pemberat anda sendiri dan halakan tugasan Digio ke titik akhir peribadi dalam ruang kerja yang sama.

Label UI tapak web B2B SaaS. Terjemah kepada ms semula jadi: Claude, GPT, Gemini Pilihan model setiap ejen Sewaan GPU & BYOM
Model terurus

Model tersedia di Digio hari ini

Tetapkan model lalai bagi setiap ejen atau ganti setiap tugas. Penggunaan dimeterkan dalam Token Digio daripada baki pelan anda—dompet yang sama sama ada ejen memanggil Sonnet, GPT-4o atau Gemini Flash.

Claude Anthropic

  • Claude Opus 4.7 Penaakulan perdana, konteks panjang, seni bina dan kerja strategi.
  • Claude Opus 4.6 Opus generasi sebelumnya untuk analisis yang stabil dan berkualiti tinggi.
  • Claude Sonnet 4.6 Pemacu harian—pengekodan, penulisan dan gelung ejen berbilang langkah.
  • Claude Sonnet 4.5 / 4 Peringkat Sonnet pantas dengan caching segera pada beban kerja yang disokong.
  • Claude Haiku 4.5 Draf kependaman rendah, klasifikasi dan subtugasan volum tinggi.

Label UI tapak web B2B SaaS. Terjemah ke ms semula jadi: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Keluarga GPT-5 terkini untuk beban kerja am dan ejen.
  • GPT-4.1 & GPT-4o Sembang multimodal dan penggunaan alat yang boleh dipercayai untuk ejen pengeluaran.
  • GPT-4o mini Penghalaan yang cekap kos untuk ringkasan dan langkah ringan.
  • o3 / o3-pro / o3-mini / o4-mini Model berfokuskan penaakulan untuk matematik, perancangan dan pengesahan.
  • GPT-5.3 Codex & Codex mini Penjanaan kod, refactor dan kemahiran ejen sedar semula.

Label UI tapak web B2B SaaS. Terjemah ke ms semula jadi: Google Gemini

  • Gemini 2.5 Pro Penyelidikan konteks panjang dan pengekstrakan berstruktur.
  • Gemini 2.5 Flash Langkah ejen berkemampuan tinggi dengan kadar token yang kompetitif.
  • Gemini 2.0 Flash Pas sangat pantas untuk menghurai, menandai dan kerja kelompok.

API terbuka & pakar

  • DeepSeek Chat & Reasoner Nilai kukuh untuk tugasan gaya sembang dan rantaian pemikiran.
  • Mistral Large Pilihan yang dihoskan Eropah untuk pasukan ejen berbilang bahasa.
  • Llama 3.3 70B Model kelas pemberat terbuka melalui API—digandingkan dengan baik dengan GPU peribadi.
  • Grok 3 Model berorientasikan masa nyata untuk berita dan ejen pemantauan sosial.
  • Sonar Pro Jawapan berasaskan carian untuk ejen penyelidikan.
  • Command R+ Sembang perusahaan mesra RAG dan aliran kerja mendapatkan semula.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Penggunaan

Cara ejen memilih model

Penyelaras boleh mengesyorkan Sonnet vs Opus vs model kilat yang lebih murah berdasarkan jenis tugas. Pengguna berkuasa menetapkan lalai bagi setiap peranan ejen—penyelidikan pada Sonnet, semakan akhir pada Opus, pengetegan pukal pada Haiku atau Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

penyewaan GPU

Sewa GPU dan jalankan model anda sendiri

Perlukan penalaan halus, pusat pemeriksaan celah udara atau penetapan harga inferens yang boleh diramal? Tambahkan kapasiti GPU khusus pada ruang kerja Digio anda, pasang tindanan penyajian yang anda suka dan arahkan ejen pada titik akhir peribadi anda.

Contoh khusus

Nod GPU setiap jam atau bulanan (kelas A100, H100, L40S) dilampirkan pada penyewa anda—diasingkan daripada pelanggan lain.

Berat awak

Muat naik safetensors, GGUF, atau tarik daripada pendaftaran anda; jalankan Llama, Mistral, Qwen dan lagu halus tersuai.

Hidangan standard

vLLM, TGI, Ollama atau imej kontena yang anda selenggara—ejen Digio memanggil URL asas yang serasi dengan OpenAI.

Orkestrasi yang sama

Untuk melakukan, sembang pasukan, kemahiran dan kerjasama tidak berubah—hanya bahagian belakang kesimpulan adalah milik anda.

Penghalaan hibrid

Hantar langkah sensitif kepada GPU peribadi dan gunakan Claude atau GPT untuk penyelidikan awam dalam satu aliran kerja.

Kawalan perusahaan

Peering VPC, jalan keluar statik, log audit dan senarai model yang dibenarkan untuk pasukan terkawal.

Bawa model anda sendiri

Pasang dan sambungkan model tersuai

Persediaan biasa dari sifar kepada ejen yang memanggil titik akhir anda:

  1. Simpan GPU

    Pilih VRAM, rantau dan masa aktif (letup vs sentiasa hidup). Storan untuk pemberat dihantar dengan contoh atau lekapkan baldi anda.

  2. Sebarkan timbunan

    Mulakan imej penyajian atau SSH masuk, pasang pemacu CUDA dan muatkan pusat pemeriksaan. Pemeriksaan kesihatan mengesahkan model sudah sedia.

  3. Daftar titik akhir

    Tambahkan URL asas, kunci API dan id model dalam tetapan ruang kerja. Digio mengesahkan kependaman dan format token sebelum disiarkan secara langsung.

  4. Tugaskan kepada ejen

    Pilih model peribadi anda sebagai lalai untuk ejen terpilih; model Claude/GPT terurus kekal tersedia bersebelahan.

Sewaan GPU dibilkan secara berasingan daripada langganan pelan Digio. Hubungi kami untuk perancangan kapasiti, SLA dan migrasi daripada kluster inferens sedia ada.

Soalan Lazim

Soalan model & GPU

Memilih API terurus berbanding inferens yang dihoskan sendiri pada Digio.

Adakah saya membayar dua kali—pelan ditambah API?

Langganan Digio anda meliputi infrastruktur, ejen dan Token Digio yang disertakan. Debit penggunaan model terurus baki token mengikut token input/output sebenar. Sewaan GPU ialah alat tambah untuk mesin yang anda kawal.

Bolehkah ejen yang berbeza menggunakan model yang berbeza?

Ya—setiap ejen boleh mempunyai lalainya sendiri. Tugasan dan sembang boleh mengatasi untuk satu larian tanpa mengubah lalai global.

Apakah perbezaan antara Sonnet dan Opus?

Opus ditala untuk alasan yang lebih keras dan rancangan yang lebih koheren; Sonnet lebih pantas dan lebih murah untuk gelung ejen setiap hari. Haiku dan model kelas kilat adalah yang terbaik untuk subtugasan volum.

Bolehkah saya menjalankan model saya sendiri dan menyekat API awan sahaja?

Ruang kerja perusahaan boleh menyekat penyedia model keluar dan menghalakan semua trafik ejen ke titik akhir GPU anda. Mod hibrid ialah lalai untuk kebanyakan pasukan.

Saiz GPU yang manakah tersedia?

Tawaran bergantung pada rantau dan permintaan—biasanya 24–80 GB peringkat VRAM untuk model kelas 7B–70B dan nod berbilang GPU untuk tindanan yang lebih besar. Kami membantu saiz VRAM daripada kiraan parameter dan kuantisasi anda.

Adakah penggunaan GPU peribadi masih menggunakan Token Digio?

Orkestrasi (ejen, tugas, storan) kekal pada rancangan anda. Inferens pada GPU anda dibilkan sebagai masa GPU; anda boleh memilih untuk mengukur penggunaan berbentuk token untuk caj balik dalaman.

Pilih model terurus atau bawa GPU anda

Mulakan pada Claude dan GPT hari ini, kemudian tambah GPU khusus apabila anda bersedia untuk mengehoskan pemberat tersuai—ejen yang sama, tugas yang sama, inferens anda.