[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"model-deepseek-v4-flash-0731":3},{"id":4,"slug":5,"name":6,"hf_id":6,"organization":7,"architecture":8,"architecture_config":9,"parameters":14,"parameters_label":15,"context_length":16,"license":17,"downloads":18,"likes":19,"status":20,"description":21,"huggingface_url":22,"created_at":23,"seo":24,"category":27,"family":30,"score":33,"variants":34,"quantizations":35,"requirements":61,"gpu_recommendations":146,"fitting_gpus":326,"community":327},429,"deepseek-v4-flash-0731","deepseek-ai\u002FDeepSeek-V4-Flash-0731","deepseek-ai","deepseek_v4",{"layers":10,"head_dim":11,"kv_heads":12,"hidden_size":13},43,512,1,4096,304180418494,"304.2B",1048576,"mit",1048685,3240,"published",null,"https:\u002F\u002Fhuggingface.co\u002Fdeepseek-ai\u002FDeepSeek-V4-Flash-0731","2026-08-13T12:41:49+00:00",{"title":6,"description":25,"image":21,"robots":26,"canonical_url":21},"AI 模型部署决策引擎——开源 AI 的 GPU 需求、云端价格与成本分析。","index, follow",{"name":28,"slug":29},"LLM","llm",{"name":31,"slug":32},"DeepSeek","deepseek",0.1242,[],[36,41,45,50,54,58],{"format":37,"bits":38,"size_factor":39,"quality_loss":40},"AWQ",4,0.263,0.03,{"format":42,"bits":43,"size_factor":12,"quality_loss":44},"FP16",16,0,{"format":46,"bits":47,"size_factor":48,"quality_loss":49},"FP8",8,0.5,0.01,{"format":51,"bits":38,"size_factor":52,"quality_loss":53},"GGUF",0.25,0.05,{"format":55,"bits":38,"size_factor":56,"quality_loss":57},"GPTQ",0.275,0.04,{"format":59,"bits":47,"size_factor":48,"quality_loss":60},"INT8",0.02,{"FP16":62,"FP8":86,"INT8":100,"AWQ":104,"GPTQ":118,"GGUF":132},{"minimum":63,"production":72,"recommended":78},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":65,"kv_cache_gb":66,"vram_gb":67,"ram_gb":68,"disk_gb":69,"requirement_source":70,"confidence":71},"minimum",566.58,0.34,722.25,1083.37,922.87,"inferred",0.95,{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":65,"kv_cache_gb":10,"vram_gb":75,"ram_gb":76,"disk_gb":77,"requirement_source":70,"confidence":71},"production",16384,887.48,1331.22,987.87,{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":65,"kv_cache_gb":82,"vram_gb":83,"ram_gb":84,"disk_gb":85,"requirement_source":70,"confidence":71},"recommended",8192,2,5.38,770.15,1155.22,948.87,{"minimum":87,"production":92,"recommended":96},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":88,"kv_cache_gb":66,"vram_gb":89,"ram_gb":90,"disk_gb":91,"requirement_source":70,"confidence":71},283.29,363.89,545.83,480.93,{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":88,"kv_cache_gb":10,"vram_gb":93,"ram_gb":94,"disk_gb":95,"requirement_source":70,"confidence":71},496.54,744.81,545.93,{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":88,"kv_cache_gb":82,"vram_gb":97,"ram_gb":98,"disk_gb":99,"requirement_source":70,"confidence":71},395.49,593.24,506.93,{"minimum":101,"production":102,"recommended":103},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":88,"kv_cache_gb":66,"vram_gb":89,"ram_gb":90,"disk_gb":91,"requirement_source":70,"confidence":71},{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":88,"kv_cache_gb":10,"vram_gb":93,"ram_gb":94,"disk_gb":95,"requirement_source":70,"confidence":71},{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":88,"kv_cache_gb":82,"vram_gb":97,"ram_gb":98,"disk_gb":99,"requirement_source":70,"confidence":71},{"minimum":105,"production":110,"recommended":114},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":106,"kv_cache_gb":66,"vram_gb":107,"ram_gb":108,"disk_gb":109,"requirement_source":70,"confidence":71},146.96,191.43,287.14,268.25,{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":106,"kv_cache_gb":10,"vram_gb":111,"ram_gb":112,"disk_gb":113,"requirement_source":70,"confidence":71},308.4,462.6,333.25,{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":106,"kv_cache_gb":82,"vram_gb":115,"ram_gb":116,"disk_gb":117,"requirement_source":70,"confidence":71},215.19,322.79,294.25,{"minimum":119,"production":124,"recommended":128},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":120,"kv_cache_gb":66,"vram_gb":121,"ram_gb":122,"disk_gb":123,"requirement_source":70,"confidence":71},148.73,193.67,290.5,271.01,{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":120,"kv_cache_gb":10,"vram_gb":125,"ram_gb":126,"disk_gb":127,"requirement_source":70,"confidence":71},310.84,466.27,336.01,{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":120,"kv_cache_gb":82,"vram_gb":129,"ram_gb":130,"disk_gb":131,"requirement_source":70,"confidence":71},217.54,326.3,297.01,{"minimum":133,"production":138,"recommended":142},{"scenario":64,"context_length":13,"batch_size":12,"weight_gb":134,"kv_cache_gb":66,"vram_gb":135,"ram_gb":136,"disk_gb":137,"requirement_source":70,"confidence":71},152.27,198.15,297.22,276.54,{"scenario":73,"context_length":74,"batch_size":38,"weight_gb":134,"kv_cache_gb":10,"vram_gb":139,"ram_gb":140,"disk_gb":141,"requirement_source":70,"confidence":71},315.73,473.6,341.54,{"scenario":79,"context_length":80,"batch_size":81,"weight_gb":134,"kv_cache_gb":82,"vram_gb":143,"ram_gb":144,"disk_gb":145,"requirement_source":70,"confidence":71},222.22,333.33,302.54,{"recommended":147,"cheapest":167,"performance":182,"min_complexity":192,"cluster_options":202,"no_match":324,"required_vram_gb":115,"candidate_count":47,"usage":325},{"gpu_model":148,"gpu_model_id":149,"gpu_count":47,"total_vram_gb":150,"hour_price":151,"monthly_cost":152,"providers":153,"bandwidth_gbps":155,"fp16_tflops":156,"interconnect_score":157,"parallel_efficiency":158,"score":159,"tier":160,"perf_metric":161,"perf_label":162,"perf_value":163,"workload":21,"cost_metric":164},"H200 SXM",11,1128,3.5,20440,[154],"lambda",4800,989,40,0.4,0.2706,"balanced","tok\u002Fs","104.5 tok\u002Fs",104.5,{"effective_value":165,"effective_unit":161,"capacity_factor":166},73.1,0.7,{"gpu_model":168,"gpu_model_id":169,"gpu_count":47,"total_vram_gb":170,"hour_price":171,"monthly_cost":172,"providers":173,"bandwidth_gbps":175,"fp16_tflops":176,"interconnect_score":157,"parallel_efficiency":158,"score":177,"tier":160,"perf_metric":161,"perf_label":178,"perf_value":179,"workload":21,"cost_metric":180},"RTX A6000",6,384,0.2874,1678.42,[174,154],"vast",768,77,0.492,"16.7 tok\u002Fs",16.7,{"effective_value":181,"effective_unit":161,"capacity_factor":166},11.7,{"gpu_model":148,"gpu_model_id":149,"gpu_count":38,"total_vram_gb":183,"hour_price":151,"monthly_cost":184,"providers":185,"bandwidth_gbps":155,"fp16_tflops":156,"interconnect_score":157,"parallel_efficiency":186,"score":187,"tier":160,"perf_metric":161,"perf_label":188,"perf_value":189,"workload":21,"cost_metric":190},564,10220,[154],0.6,0.3711,"78.4 tok\u002Fs",78.4,{"effective_value":191,"effective_unit":161,"capacity_factor":166},54.9,{"gpu_model":148,"gpu_model_id":149,"gpu_count":81,"total_vram_gb":193,"hour_price":151,"monthly_cost":194,"providers":195,"bandwidth_gbps":155,"fp16_tflops":156,"interconnect_score":157,"parallel_efficiency":196,"score":197,"tier":160,"perf_metric":161,"perf_label":198,"perf_value":199,"workload":21,"cost_metric":200},282,5110,[154],0.8,0.5924,"52.3 tok\u002Fs",52.3,{"effective_value":201,"effective_unit":161,"capacity_factor":166},36.6,[203,216,225,233,242,251,258,268,273,282,289,296,303,314],{"gpu_model":204,"gpu_model_id":205,"gpu_count":47,"total_vram_gb":206,"hour_price":207,"monthly_cost":208,"providers":209,"bandwidth_gbps":211,"fp16_tflops":212,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":215,"tier":160},"RTX 3090",3,192,0.0678,395.95,[174,210],"tensordock",936,71,true,23.19,0.5198,{"gpu_model":217,"gpu_model_id":12,"gpu_count":47,"total_vram_gb":206,"hour_price":218,"monthly_cost":219,"providers":220,"bandwidth_gbps":222,"fp16_tflops":223,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":224,"tier":160},"RTX 4090",0.1344,784.9,[174,210,221,154],"runpod",1008,165,0.5134,{"gpu_model":226,"gpu_model_id":227,"gpu_count":47,"total_vram_gb":206,"hour_price":228,"monthly_cost":229,"providers":230,"bandwidth_gbps":222,"fp16_tflops":231,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":232,"tier":160},"RTX 4090D",5,0.1602,935.57,[174],82.6,0.5102,{"gpu_model":234,"gpu_model_id":235,"gpu_count":47,"total_vram_gb":206,"hour_price":236,"monthly_cost":237,"providers":238,"bandwidth_gbps":239,"fp16_tflops":240,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":241,"tier":160},"A10",7,0.2015,1176.76,[174,221],600,125,0.4959,{"gpu_model":243,"gpu_model_id":244,"gpu_count":47,"total_vram_gb":206,"hour_price":245,"monthly_cost":246,"providers":247,"bandwidth_gbps":248,"fp16_tflops":249,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":250,"tier":160},"L4",13,0.2022,1180.85,[174],300,121,0.4889,{"gpu_model":252,"gpu_model_id":253,"gpu_count":47,"total_vram_gb":206,"hour_price":254,"monthly_cost":255,"providers":256,"bandwidth_gbps":44,"fp16_tflops":44,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":214,"score":257,"tier":160},"RTX PRO 5000",26,0.483,2820.72,[174],0.4479,{"gpu_model":259,"gpu_model_id":260,"gpu_count":47,"total_vram_gb":261,"hour_price":262,"monthly_cost":263,"providers":264,"bandwidth_gbps":44,"fp16_tflops":44,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":266,"tier":267},"Tesla V100",17,128,0.0272,158.85,[174],87.19,0.5034,"cheapest",{"gpu_model":269,"gpu_model_id":270,"gpu_count":47,"total_vram_gb":261,"hour_price":207,"monthly_cost":208,"providers":271,"bandwidth_gbps":44,"fp16_tflops":44,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":272,"tier":160},"RTX 4070S Ti",22,[174],0.4984,{"gpu_model":274,"gpu_model_id":275,"gpu_count":47,"total_vram_gb":261,"hour_price":276,"monthly_cost":277,"providers":278,"bandwidth_gbps":279,"fp16_tflops":280,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":281,"tier":160},"RTX 5070 Ti",18,0.0849,495.82,[174],896,88,0.5168,{"gpu_model":283,"gpu_model_id":284,"gpu_count":47,"total_vram_gb":261,"hour_price":285,"monthly_cost":286,"providers":287,"bandwidth_gbps":44,"fp16_tflops":44,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":288,"tier":160},"RTX 4080S",21,0.1192,696.13,[174],0.4922,{"gpu_model":290,"gpu_model_id":291,"gpu_count":47,"total_vram_gb":261,"hour_price":218,"monthly_cost":219,"providers":292,"bandwidth_gbps":293,"fp16_tflops":294,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":295,"tier":160},"RTX 5080",23,[174],960,113,0.5123,{"gpu_model":297,"gpu_model_id":298,"gpu_count":47,"total_vram_gb":261,"hour_price":299,"monthly_cost":300,"providers":301,"bandwidth_gbps":44,"fp16_tflops":44,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":265,"score":302,"tier":160},"RTX PRO 4500",25,0.3222,1881.65,[174],0.4675,{"gpu_model":304,"gpu_model_id":305,"gpu_count":47,"total_vram_gb":306,"hour_price":307,"monthly_cost":308,"providers":309,"bandwidth_gbps":310,"fp16_tflops":311,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":312,"score":313,"tier":267},"RTX 5070",28,96,0.0101,58.98,[174],672,61,119.19,0.5208,{"gpu_model":315,"gpu_model_id":316,"gpu_count":47,"total_vram_gb":317,"hour_price":318,"monthly_cost":319,"providers":320,"bandwidth_gbps":321,"fp16_tflops":316,"interconnect_score":157,"parallel_efficiency":158,"insufficient":213,"vram_shortfall_gb":322,"score":323,"tier":160},"RTX 5060 Ti",24,64,0.0544,317.7,[174],448,151.19,0.5103,false,"value",[],{"posts_count":44,"benchmarks_count":44}]