OCR / VisionMIT
CogVLM2 19B
THUDM/cogvlm2-llama3-chat-19B
Parameters
19B
Context
8K
Downloads
6.4K
Likes
220
Architecture
transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 48.3 GB RAM 72.5 · Disk 94.2 | 52.6 GB RAM 78.8 · Disk 120.2 | 70.4 GB RAM 105.7 · Disk 159.2 |
| FP88bit | 26.0 GB RAM 38.9 · Disk 66.6 | 29.2 GB RAM 43.7 · Disk 92.6 | 46.0 GB RAM 69.0 · Disk 131.6 |
| INT88bit | 26.0 GB RAM 38.9 · Disk 66.6 | 29.2 GB RAM 43.7 · Disk 92.6 | 46.0 GB RAM 69.0 · Disk 131.6 |
| AWQ4bit | 15.2 GB RAM 32.0 · Disk 53.3 | 17.9 GB RAM 32.0 · Disk 79.3 | 34.3 GB RAM 51.4 · Disk 118.3 |
| GPTQ4bit | 15.3 GB RAM 32.0 · Disk 53.5 | 18.0 GB RAM 32.0 · Disk 79.5 | 34.4 GB RAM 51.6 · Disk 118.5 |
| GGUF4bit | 15.6 GB RAM 32.0 · Disk 53.8 | 18.3 GB RAM 32.0 · Disk 79.8 | 34.7 GB RAM 52.1 · Disk 118.8 |
GPU Recommendations
Best ValueBEST
1× RTX 5090
32 GB VRAM
$294/mo
≈ 195.2 tok/s
Effective production throughput ≈ 136.6 tok/s
score 0.6458
Cheapest
1× L4
24 GB VRAM
$79.5/mo
≈ 32.7 tok/s
Effective production throughput ≈ 22.9 tok/s
score 0.6893
Performance
8× H200 SXM
1128 GB VRAM
$20,440/mo
≈ 1673.2 tok/s
Effective production throughput ≈ 1171.2 tok/s
score 0.2197
Min Complexity
1× RTX 3090
24 GB VRAM
$88.4/mo
≈ 102 tok/s
Effective production throughput ≈ 71.4 tok/s
score 0.6936
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
L4
24 GB VRAM
$79.5
/mo · vast
RTX 3090
24 GB VRAM
$88.4
/mo · vast
A10
24 GB VRAM
$177
/mo · vast
RTX 4090
24 GB VRAM
$190
/mo · tensordock
RTX 5090D
32 GB VRAM
$245
/mo · vast