[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"model-llama-4-scout":3},{"id":4,"slug":5,"name":6,"hf_id":7,"organization":8,"architecture":9,"architecture_config":10,"parameters":11,"parameters_label":12,"context_length":13,"license":14,"downloads":15,"likes":16,"status":17,"description":10,"huggingface_url":18,"created_at":19,"seo":20,"category":23,"family":26,"score":29,"variants":30,"quantizations":31,"requirements":58,"gpu_recommendations":143,"fitting_gpus":209,"community":225},217,"llama-4-scout","Llama 4 Scout","meta-llama\u002FLlama-4-Scout-17B-16E-Instruct","meta-llama","moe_transformer",null,109000000000,"109B",10485760,"MIT",460443,1332,"published","https:\u002F\u002Fhuggingface.co\u002Fmeta-llama\u002FLlama-4-Scout-17B-16E-Instruct","2026-08-12T03:11:17+00:00",{"title":6,"description":21,"image":10,"robots":22,"canonical_url":10},"AI 模型部署决策引擎——开源 AI 的 GPU 需求、云端价格与成本分析。","index, follow",{"name":24,"slug":25},"LLM","llm",{"name":27,"slug":28},"Llama","llama",0.1047,[],[32,37,42,47,51,55],{"format":33,"bits":34,"size_factor":35,"quality_loss":36},"AWQ",4,0.263,0.03,{"format":38,"bits":39,"size_factor":40,"quality_loss":41},"FP16",16,1,0,{"format":43,"bits":44,"size_factor":45,"quality_loss":46},"FP8",8,0.5,0.01,{"format":48,"bits":34,"size_factor":49,"quality_loss":50},"GGUF",0.25,0.05,{"format":52,"bits":34,"size_factor":53,"quality_loss":54},"GPTQ",0.275,0.04,{"format":56,"bits":44,"size_factor":45,"quality_loss":57},"INT8",0.02,{"FP16":59,"FP8":83,"INT8":97,"AWQ":101,"GPTQ":115,"GGUF":129},{"minimum":60,"production":69,"recommended":76},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":63,"kv_cache_gb":45,"vram_gb":64,"ram_gb":65,"disk_gb":66,"requirement_source":67,"confidence":68},"minimum",4096,203.03,261.78,392.67,355.72,"estimated",0.95,{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":63,"kv_cache_gb":72,"vram_gb":73,"ram_gb":74,"disk_gb":75,"requirement_source":67,"confidence":68},"production",16384,64,397.78,596.67,420.72,{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":63,"kv_cache_gb":44,"vram_gb":80,"ram_gb":81,"disk_gb":82,"requirement_source":67,"confidence":68},"recommended",8192,2,289.2,433.81,381.72,{"minimum":84,"production":89,"recommended":93},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":85,"kv_cache_gb":45,"vram_gb":86,"ram_gb":87,"disk_gb":88,"requirement_source":67,"confidence":68},101.51,133.37,200.05,197.36,{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":85,"kv_cache_gb":72,"vram_gb":90,"ram_gb":91,"disk_gb":92,"requirement_source":67,"confidence":68},257.69,386.53,262.36,{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":85,"kv_cache_gb":44,"vram_gb":94,"ram_gb":95,"disk_gb":96,"requirement_source":67,"confidence":68},154.95,232.43,223.36,{"minimum":98,"production":99,"recommended":100},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":85,"kv_cache_gb":45,"vram_gb":86,"ram_gb":87,"disk_gb":88,"requirement_source":67,"confidence":68},{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":85,"kv_cache_gb":72,"vram_gb":90,"ram_gb":91,"disk_gb":92,"requirement_source":67,"confidence":68},{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":85,"kv_cache_gb":44,"vram_gb":94,"ram_gb":95,"disk_gb":96,"requirement_source":67,"confidence":68},{"minimum":102,"production":107,"recommended":111},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":103,"kv_cache_gb":45,"vram_gb":104,"ram_gb":105,"disk_gb":106,"requirement_source":67,"confidence":68},52.66,71.57,107.35,121.15,{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":103,"kv_cache_gb":72,"vram_gb":108,"ram_gb":109,"disk_gb":110,"requirement_source":67,"confidence":68},190.27,285.41,186.15,{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":103,"kv_cache_gb":44,"vram_gb":112,"ram_gb":113,"disk_gb":114,"requirement_source":67,"confidence":68},90.34,135.52,147.15,{"minimum":116,"production":121,"recommended":125},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":117,"kv_cache_gb":45,"vram_gb":118,"ram_gb":119,"disk_gb":120,"requirement_source":67,"confidence":68},53.29,72.37,108.55,122.14,{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":117,"kv_cache_gb":72,"vram_gb":122,"ram_gb":123,"disk_gb":124,"requirement_source":67,"confidence":68},191.15,286.72,187.14,{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":117,"kv_cache_gb":44,"vram_gb":126,"ram_gb":127,"disk_gb":128,"requirement_source":67,"confidence":68},91.18,136.77,148.14,{"minimum":130,"production":135,"recommended":139},{"scenario":61,"context_length":62,"batch_size":40,"weight_gb":131,"kv_cache_gb":45,"vram_gb":132,"ram_gb":133,"disk_gb":134,"requirement_source":67,"confidence":68},54.56,73.97,110.96,124.12,{"scenario":70,"context_length":71,"batch_size":34,"weight_gb":131,"kv_cache_gb":72,"vram_gb":136,"ram_gb":137,"disk_gb":138,"requirement_source":67,"confidence":68},192.9,289.35,189.12,{"scenario":77,"context_length":78,"batch_size":79,"weight_gb":131,"kv_cache_gb":44,"vram_gb":140,"ram_gb":141,"disk_gb":142,"requirement_source":67,"confidence":68},92.86,139.29,150.12,{"recommended":144,"cheapest":164,"performance":177,"min_complexity":186,"cluster_options":195,"no_match":206,"required_vram_gb":112,"candidate_count":207,"usage":208},{"gpu_model":145,"gpu_model_id":146,"gpu_count":34,"total_vram_gb":147,"hour_price":148,"monthly_cost":149,"providers":150,"bandwidth_gbps":152,"fp16_tflops":153,"interconnect_score":154,"parallel_efficiency":155,"score":156,"tier":157,"perf_metric":158,"perf_label":159,"perf_value":160,"workload":10,"cost_metric":161},"H200 SXM",11,564,3.5,10220,[151],"lambda",4800,989,40,0.6,0.3121,"balanced","tok\u002Fs","218.8 tok\u002Fs",218.8,{"effective_value":162,"effective_unit":158,"capacity_factor":163},153.2,0.7,{"gpu_model":165,"gpu_model_id":166,"gpu_count":44,"total_vram_gb":167,"hour_price":168,"monthly_cost":169,"providers":170,"bandwidth_gbps":41,"fp16_tflops":41,"interconnect_score":154,"parallel_efficiency":172,"score":173,"tier":174,"perf_metric":158,"perf_label":175,"perf_value":41,"workload":10,"cost_metric":176},"Tesla V100",17,128,0.0272,158.85,[171],"vast",0.4,0.5449,"cheapest","0 tok\u002Fs",{"effective_value":41,"effective_unit":158,"capacity_factor":163},{"gpu_model":145,"gpu_model_id":146,"gpu_count":44,"total_vram_gb":178,"hour_price":148,"monthly_cost":179,"providers":180,"bandwidth_gbps":152,"fp16_tflops":153,"interconnect_score":154,"parallel_efficiency":172,"score":181,"tier":157,"perf_metric":158,"perf_label":182,"perf_value":183,"workload":10,"cost_metric":184},1128,20440,[151],0.2197,"291.7 tok\u002Fs",291.7,{"effective_value":185,"effective_unit":158,"capacity_factor":163},204.2,{"gpu_model":145,"gpu_model_id":146,"gpu_count":40,"total_vram_gb":187,"hour_price":148,"monthly_cost":188,"providers":189,"bandwidth_gbps":152,"fp16_tflops":153,"interconnect_score":154,"parallel_efficiency":40,"score":190,"tier":157,"perf_metric":158,"perf_label":191,"perf_value":192,"workload":10,"cost_metric":193},141,2555,[151],0.6419,"91.2 tok\u002Fs",91.2,{"effective_value":194,"effective_unit":158,"capacity_factor":163},63.8,[196],{"gpu_model":197,"gpu_model_id":198,"gpu_count":44,"total_vram_gb":72,"hour_price":199,"monthly_cost":200,"providers":201,"bandwidth_gbps":202,"fp16_tflops":198,"interconnect_score":154,"parallel_efficiency":172,"insufficient":203,"vram_shortfall_gb":204,"score":205,"tier":157},"RTX 5060 Ti",24,0.0554,323.54,[171],448,true,26.34,0.5102,false,18,"value",[210,214,222],{"name":145,"vram_gb":187,"cheapest_hour":148,"cost":211,"provider":151,"estimated_tps":192},{"hourly":148,"daily":212,"monthly":188,"yearly":213},84,30660,{"name":215,"vram_gb":216,"cheapest_hour":217,"cost":218,"provider":171,"estimated_tps":41},"B200",180,4.1271,{"hourly":217,"daily":219,"monthly":220,"yearly":221},99.05,3012.78,36153.4,{"name":223,"vram_gb":216,"cheapest_hour":10,"cost":10,"provider":10,"estimated_tps":224},"B200 SXM",148.1,{"posts_count":41,"benchmarks_count":41}]