[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"model-qwen3-4b":3},{"id":4,"slug":5,"name":6,"hf_id":6,"organization":7,"architecture":8,"architecture_config":9,"parameters":14,"parameters_label":15,"context_length":16,"license":17,"downloads":18,"likes":19,"status":20,"description":17,"huggingface_url":21,"created_at":22,"seo":23,"category":26,"family":29,"score":31,"variants":32,"quantizations":33,"requirements":59,"gpu_recommendations":139,"fitting_gpus":204,"community":240},348,"qwen3-4b","Qwen\u002FQwen3-4B","Qwen","qwen3",{"layers":10,"head_dim":11,"kv_heads":12,"hidden_size":13},36,128,8,2560,3220111360,"3.2B",40960,null,4709881,678,"published","https:\u002F\u002Fhuggingface.co\u002FQwen\u002FQwen3-4B","2026-08-12T03:11:24+00:00",{"title":6,"description":24,"image":17,"robots":25,"canonical_url":17},"AI 模型部署决策引擎——开源 AI 的 GPU 需求、云端价格与成本分析。","index, follow",{"name":27,"slug":28},"LLM","llm",{"name":7,"slug":30},"qwen",0.0149,[],[34,39,44,48,52,56],{"format":35,"bits":36,"size_factor":37,"quality_loss":38},"AWQ",4,0.263,0.03,{"format":40,"bits":41,"size_factor":42,"quality_loss":43},"FP16",16,1,0,{"format":45,"bits":12,"size_factor":46,"quality_loss":47},"FP8",0.5,0.01,{"format":49,"bits":36,"size_factor":50,"quality_loss":51},"GGUF",0.25,0.05,{"format":53,"bits":36,"size_factor":54,"quality_loss":55},"GPTQ",0.275,0.04,{"format":57,"bits":12,"size_factor":46,"quality_loss":58},"INT8",0.02,{"FP16":60,"FP8":84,"INT8":97,"AWQ":101,"GPTQ":114,"GGUF":127},{"minimum":61,"production":70,"recommended":77},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":64,"kv_cache_gb":46,"vram_gb":65,"ram_gb":66,"disk_gb":67,"requirement_source":68,"confidence":69},"minimum",4096,7.45,14.37,32,50.62,"estimated",0.95,{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":64,"kv_cache_gb":73,"vram_gb":74,"ram_gb":75,"disk_gb":76,"requirement_source":68,"confidence":69},"production",16384,64,127.88,191.82,115.62,{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":64,"kv_cache_gb":12,"vram_gb":81,"ram_gb":82,"disk_gb":83,"requirement_source":68,"confidence":69},"recommended",8192,2,30.55,45.83,76.62,{"minimum":85,"production":89,"recommended":93},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":86,"kv_cache_gb":46,"vram_gb":87,"ram_gb":66,"disk_gb":88,"requirement_source":68,"confidence":69},3.73,9.66,44.81,{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":86,"kv_cache_gb":73,"vram_gb":90,"ram_gb":91,"disk_gb":92,"requirement_source":68,"confidence":69},122.74,184.11,109.81,{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":86,"kv_cache_gb":12,"vram_gb":94,"ram_gb":95,"disk_gb":96,"requirement_source":68,"confidence":69},25.63,38.44,70.81,{"minimum":98,"production":99,"recommended":100},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":86,"kv_cache_gb":46,"vram_gb":87,"ram_gb":66,"disk_gb":88,"requirement_source":68,"confidence":69},{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":86,"kv_cache_gb":73,"vram_gb":90,"ram_gb":91,"disk_gb":92,"requirement_source":68,"confidence":69},{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":86,"kv_cache_gb":12,"vram_gb":94,"ram_gb":95,"disk_gb":96,"requirement_source":68,"confidence":69},{"minimum":102,"production":106,"recommended":110},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":103,"kv_cache_gb":46,"vram_gb":104,"ram_gb":66,"disk_gb":105,"requirement_source":68,"confidence":69},1.93,7.39,42.01,{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":103,"kv_cache_gb":73,"vram_gb":107,"ram_gb":108,"disk_gb":109,"requirement_source":68,"confidence":69},120.27,180.4,107.01,{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":103,"kv_cache_gb":12,"vram_gb":111,"ram_gb":112,"disk_gb":113,"requirement_source":68,"confidence":69},23.26,34.88,68.01,{"minimum":115,"production":119,"recommended":123},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":116,"kv_cache_gb":46,"vram_gb":117,"ram_gb":66,"disk_gb":118,"requirement_source":68,"confidence":69},1.96,7.42,42.05,{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":116,"kv_cache_gb":73,"vram_gb":120,"ram_gb":121,"disk_gb":122,"requirement_source":68,"confidence":69},120.3,180.45,107.05,{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":116,"kv_cache_gb":12,"vram_gb":124,"ram_gb":125,"disk_gb":126,"requirement_source":68,"confidence":69},23.29,34.93,68.05,{"minimum":128,"production":131,"recommended":135},{"scenario":62,"context_length":63,"batch_size":42,"weight_gb":80,"kv_cache_gb":46,"vram_gb":129,"ram_gb":66,"disk_gb":130,"requirement_source":68,"confidence":69},7.48,42.12,{"scenario":71,"context_length":72,"batch_size":36,"weight_gb":80,"kv_cache_gb":73,"vram_gb":132,"ram_gb":133,"disk_gb":134,"requirement_source":68,"confidence":69},120.36,180.54,107.12,{"scenario":78,"context_length":79,"batch_size":80,"weight_gb":80,"kv_cache_gb":12,"vram_gb":136,"ram_gb":137,"disk_gb":138,"requirement_source":68,"confidence":69},23.35,35.02,68.12,{"recommended":140,"cheapest":158,"performance":168,"min_complexity":185,"cluster_options":200,"no_match":201,"required_vram_gb":111,"candidate_count":202,"usage":203},{"gpu_model":141,"gpu_model_id":80,"gpu_count":42,"total_vram_gb":66,"hour_price":142,"monthly_cost":143,"providers":144,"bandwidth_gbps":147,"fp16_tflops":148,"interconnect_score":149,"parallel_efficiency":42,"score":150,"tier":151,"perf_metric":152,"perf_label":153,"perf_value":154,"workload":17,"cost_metric":155},"RTX 5090",0.3222,235.21,[145,146],"vast","runpod",1792,209,40,0.6917,"cheapest","tok\u002Fs","928.5 tok\u002Fs",928.5,{"effective_value":156,"effective_unit":152,"capacity_factor":157},649.9,0.7,{"gpu_model":159,"gpu_model_id":160,"gpu_count":80,"total_vram_gb":66,"hour_price":161,"monthly_cost":162,"providers":163,"bandwidth_gbps":43,"fp16_tflops":43,"interconnect_score":149,"parallel_efficiency":164,"score":165,"tier":151,"perf_metric":152,"perf_label":166,"perf_value":43,"workload":17,"cost_metric":167},"Tesla V100",17,0.0272,39.71,[145],0.8,0.6405,"0 tok\u002Fs",{"effective_value":43,"effective_unit":152,"capacity_factor":157},{"gpu_model":169,"gpu_model_id":170,"gpu_count":12,"total_vram_gb":171,"hour_price":172,"monthly_cost":173,"providers":174,"bandwidth_gbps":176,"fp16_tflops":177,"interconnect_score":149,"parallel_efficiency":178,"score":179,"tier":180,"perf_metric":152,"perf_label":181,"perf_value":182,"workload":17,"cost_metric":183},"H200 SXM",11,1128,3.5,20440,[175],"lambda",4800,989,0.4,0.2197,"balanced","7958.5 tok\u002Fs",7958.5,{"effective_value":184,"effective_unit":152,"capacity_factor":157},5571,{"gpu_model":186,"gpu_model_id":187,"gpu_count":42,"total_vram_gb":188,"hour_price":189,"monthly_cost":190,"providers":191,"bandwidth_gbps":193,"fp16_tflops":194,"interconnect_score":149,"parallel_efficiency":42,"score":195,"tier":151,"perf_metric":152,"perf_label":196,"perf_value":197,"workload":17,"cost_metric":198},"RTX 3090",3,24,0.0678,49.49,[145,192],"tensordock",936,71,0.6423,"485 tok\u002Fs",485,{"effective_value":199,"effective_unit":152,"capacity_factor":157},339.5,[],false,25,"value",[205,209,217,224,232],{"name":186,"vram_gb":188,"cheapest_hour":189,"cost":206,"provider":145,"estimated_tps":197},{"hourly":189,"daily":207,"monthly":190,"yearly":208},1.63,593.93,{"name":210,"vram_gb":188,"cheapest_hour":211,"cost":212,"provider":145,"estimated_tps":216},"RTX 4090",0.1344,{"hourly":211,"daily":213,"monthly":214,"yearly":215},3.23,98.11,1177.34,522.3,{"name":218,"vram_gb":188,"cheapest_hour":219,"cost":220,"provider":145,"estimated_tps":216},"RTX 4090D",0.1602,{"hourly":219,"daily":221,"monthly":222,"yearly":223},3.84,116.95,1403.35,{"name":225,"vram_gb":188,"cheapest_hour":226,"cost":227,"provider":145,"estimated_tps":231},"L4",0.2015,{"hourly":226,"daily":228,"monthly":229,"yearly":230},4.84,147.1,1765.14,155.4,{"name":233,"vram_gb":188,"cheapest_hour":234,"cost":235,"provider":145,"estimated_tps":239},"A10",0.2409,{"hourly":234,"daily":236,"monthly":237,"yearly":238},5.78,175.86,2110.28,310.9,{"posts_count":43,"benchmarks_count":43}]