[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"model-ms-marco-minilm-l6-v2":3},{"id":4,"slug":5,"name":6,"hf_id":6,"organization":7,"architecture":8,"architecture_config":9,"parameters":13,"parameters_label":14,"context_length":15,"license":16,"downloads":17,"likes":18,"status":19,"description":16,"huggingface_url":20,"created_at":21,"seo":22,"category":16,"family":25,"score":27,"variants":28,"quantizations":29,"requirements":56,"gpu_recommendations":110,"fitting_gpus":171,"community":199},432,"ms-marco-minilm-l6-v2","cross-encoder\u002Fms-marco-MiniLM-L6-v2","cross-encoder","bert",{"layers":10,"head_dim":11,"hidden_size":12},6,32,384,22337280,"22.3M",512,null,87976556,300,"published","https:\u002F\u002Fhuggingface.co\u002Fcross-encoder\u002Fms-marco-MiniLM-L6-v2","2026-08-13T18:00:31+00:00",{"title":6,"description":23,"image":16,"robots":24,"canonical_url":16},"AI 模型部署决策引擎——开源 AI 的 GPU 需求、云端价格与成本分析。","index, follow",{"name":26,"slug":7},"Cross-encoder",0.1414,[],[30,35,40,45,49,53],{"format":31,"bits":32,"size_factor":33,"quality_loss":34},"AWQ",4,0.263,0.03,{"format":36,"bits":37,"size_factor":38,"quality_loss":39},"FP16",16,1,0,{"format":41,"bits":42,"size_factor":43,"quality_loss":44},"FP8",8,0.5,0.01,{"format":46,"bits":32,"size_factor":47,"quality_loss":48},"GGUF",0.25,0.05,{"format":50,"bits":32,"size_factor":51,"quality_loss":52},"GPTQ",0.275,0.04,{"format":54,"bits":42,"size_factor":43,"quality_loss":55},"INT8",0.02,{"FP16":57,"FP8":78,"INT8":88,"AWQ":92,"GPTQ":102,"GGUF":106},{"minimum":58,"production":65,"recommended":71},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":52,"kv_cache_gb":55,"vram_gb":61,"ram_gb":11,"disk_gb":62,"requirement_source":63,"confidence":64},"minimum",4096,2.32,39.06,"inferred",0.95,{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":52,"kv_cache_gb":68,"vram_gb":69,"ram_gb":11,"disk_gb":70,"requirement_source":63,"confidence":64},"production",16384,3,6.73,104.06,{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":52,"kv_cache_gb":75,"vram_gb":76,"ram_gb":11,"disk_gb":77,"requirement_source":63,"confidence":64},"recommended",8192,2,0.38,2.95,65.06,{"minimum":79,"production":82,"recommended":85},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":55,"kv_cache_gb":55,"vram_gb":80,"ram_gb":11,"disk_gb":81,"requirement_source":63,"confidence":64},2.29,39.03,{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":55,"kv_cache_gb":68,"vram_gb":83,"ram_gb":11,"disk_gb":84,"requirement_source":63,"confidence":64},6.7,104.03,{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":55,"kv_cache_gb":75,"vram_gb":86,"ram_gb":11,"disk_gb":87,"requirement_source":63,"confidence":64},2.92,65.03,{"minimum":89,"production":90,"recommended":91},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":55,"kv_cache_gb":55,"vram_gb":80,"ram_gb":11,"disk_gb":81,"requirement_source":63,"confidence":64},{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":55,"kv_cache_gb":68,"vram_gb":83,"ram_gb":11,"disk_gb":84,"requirement_source":63,"confidence":64},{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":55,"kv_cache_gb":75,"vram_gb":86,"ram_gb":11,"disk_gb":87,"requirement_source":63,"confidence":64},{"minimum":93,"production":96,"recommended":99},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":44,"kv_cache_gb":55,"vram_gb":94,"ram_gb":11,"disk_gb":95,"requirement_source":63,"confidence":64},2.28,39.02,{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":44,"kv_cache_gb":68,"vram_gb":97,"ram_gb":11,"disk_gb":98,"requirement_source":63,"confidence":64},6.69,104.02,{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":44,"kv_cache_gb":75,"vram_gb":100,"ram_gb":11,"disk_gb":101,"requirement_source":63,"confidence":64},2.91,65.02,{"minimum":103,"production":104,"recommended":105},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":44,"kv_cache_gb":55,"vram_gb":94,"ram_gb":11,"disk_gb":95,"requirement_source":63,"confidence":64},{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":44,"kv_cache_gb":68,"vram_gb":97,"ram_gb":11,"disk_gb":98,"requirement_source":63,"confidence":64},{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":44,"kv_cache_gb":75,"vram_gb":100,"ram_gb":11,"disk_gb":101,"requirement_source":63,"confidence":64},{"minimum":107,"production":108,"recommended":109},{"scenario":59,"context_length":60,"batch_size":38,"weight_gb":44,"kv_cache_gb":55,"vram_gb":94,"ram_gb":11,"disk_gb":95,"requirement_source":63,"confidence":64},{"scenario":66,"context_length":67,"batch_size":32,"weight_gb":44,"kv_cache_gb":68,"vram_gb":97,"ram_gb":11,"disk_gb":98,"requirement_source":63,"confidence":64},{"scenario":72,"context_length":73,"batch_size":74,"weight_gb":44,"kv_cache_gb":75,"vram_gb":100,"ram_gb":11,"disk_gb":101,"requirement_source":63,"confidence":64},{"recommended":111,"cheapest":129,"performance":138,"min_complexity":155,"cluster_options":167,"no_match":168,"required_vram_gb":100,"candidate_count":169,"usage":170},{"gpu_model":112,"gpu_model_id":113,"gpu_count":38,"total_vram_gb":37,"hour_price":114,"monthly_cost":115,"providers":116,"bandwidth_gbps":118,"fp16_tflops":119,"interconnect_score":120,"parallel_efficiency":38,"score":121,"tier":122,"perf_metric":123,"perf_label":124,"perf_value":125,"workload":16,"cost_metric":126},"RTX 5080",23,0.1078,78.69,[117],"vast",960,113,40,0.5437,"cheapest","tok\u002Fs","96000 tok\u002Fs",96000,{"effective_value":127,"effective_unit":123,"capacity_factor":128},67200,0.7,{"gpu_model":130,"gpu_model_id":131,"gpu_count":38,"total_vram_gb":37,"hour_price":132,"monthly_cost":133,"providers":134,"bandwidth_gbps":39,"fp16_tflops":39,"interconnect_score":120,"parallel_efficiency":38,"score":135,"tier":122,"perf_metric":123,"perf_label":136,"perf_value":39,"workload":16,"cost_metric":137},"Tesla V100",17,0.0272,19.86,[117],0.5381,"0 tok\u002Fs",{"effective_value":39,"effective_unit":123,"capacity_factor":128},{"gpu_model":139,"gpu_model_id":140,"gpu_count":42,"total_vram_gb":141,"hour_price":142,"monthly_cost":143,"providers":144,"bandwidth_gbps":146,"fp16_tflops":147,"interconnect_score":120,"parallel_efficiency":148,"score":149,"tier":150,"perf_metric":123,"perf_label":151,"perf_value":152,"workload":16,"cost_metric":153},"H200 SXM",11,1128,3.5,20440,[145],"lambda",4800,989,0.4,0.2197,"balanced","1536000 tok\u002Fs",1536000,{"effective_value":154,"effective_unit":123,"capacity_factor":128},1075200,{"gpu_model":156,"gpu_model_id":157,"gpu_count":38,"total_vram_gb":42,"hour_price":158,"monthly_cost":159,"providers":160,"bandwidth_gbps":161,"fp16_tflops":157,"interconnect_score":120,"parallel_efficiency":38,"score":162,"tier":122,"perf_metric":123,"perf_label":163,"perf_value":164,"workload":16,"cost_metric":165},"RTX 5060 Ti",24,0.0554,40.44,[117],448,0.5894,"44800 tok\u002Fs",44800,{"effective_value":166,"effective_unit":123,"capacity_factor":128},31360,[],false,27,"value",[172,176,180,188,191],{"name":130,"vram_gb":37,"cheapest_hour":132,"cost":173,"provider":117,"estimated_tps":39},{"hourly":132,"daily":174,"monthly":133,"yearly":175},0.65,238.27,{"name":156,"vram_gb":42,"cheapest_hour":158,"cost":177,"provider":117,"estimated_tps":164},{"hourly":158,"daily":178,"monthly":159,"yearly":179},1.33,485.3,{"name":181,"vram_gb":157,"cheapest_hour":182,"cost":183,"provider":117,"estimated_tps":187},"RTX 3090",0.0678,{"hourly":182,"daily":184,"monthly":185,"yearly":186},1.63,49.49,593.93,93600,{"name":189,"vram_gb":37,"cheapest_hour":182,"cost":190,"provider":117,"estimated_tps":39},"RTX 4070S Ti",{"hourly":182,"daily":184,"monthly":185,"yearly":186},{"name":192,"vram_gb":193,"cheapest_hour":194,"cost":195,"provider":117,"estimated_tps":127},"RTX 5070",12,0.0804,{"hourly":194,"daily":196,"monthly":197,"yearly":198},1.93,58.69,704.3,{"posts_count":39,"benchmarks_count":39}]