mirror of
https://github.com/GoogleCloudPlatform/vertex-ai-samples.git
synced 2026-09-26 14:42:04 +00:00
Add Qwen3-235B-A22B-Instruct-2507 models to Qwen3 deployment notebook.
PiperOrigin-RevId: 786375387
This commit is contained in:
committed by
Copybara-Service
parent
a29f7a376b
commit
44a63c8186
@@ -230,7 +230,7 @@
|
||||
"\n",
|
||||
"# @markdown Set the model to deploy.\n",
|
||||
"\n",
|
||||
"base_model_name = \"Qwen3-235B-A22B\" # @param [\"Qwen3-235B-A22B\", \"Qwen3-235B-A22B-FP8\", \"Qwen3-30B-A3B\", \"Qwen3-30B-A3B-Base\", \"Qwen/Qwen3-30B-A3B-FP8\", \"Qwen3-32B\", \"Qwen/Qwen3-32B-FP8\", \"Qwen3-14B\", \"Qwen3-14B-Base\", \"Qwen/Qwen3-14B-FP8\", \"Qwen3-8B\", \"Qwen3-8B-Base\", \"Qwen/Qwen3-8B-FP8\", \"Qwen3-4B\", \"Qwen3-4B-Base\", \"Qwen/Qwen3-4B-FP8\", \"Qwen3-1.7B\", \"Qwen3-1.7B-Base\", \"Qwen/Qwen3-1.7B-FP8\", \"Qwen3-0.6B\", \"Qwen3-0.6B-Base\", \"Qwen/Qwen3-0.6B-FP8\"] {isTemplate:true}\n",
|
||||
"base_model_name = \"Qwen3-235B-A22B-Instruct-2507\" # @param [\"Qwen3-235B-A22B-Instruct-2507\", \"Qwen3-235B-A22B-Instruct-2507-FP8\", \"Qwen3-235B-A22B\", \"Qwen3-235B-A22B-FP8\", \"Qwen3-30B-A3B\", \"Qwen3-30B-A3B-Base\", \"Qwen/Qwen3-30B-A3B-FP8\", \"Qwen3-32B\", \"Qwen/Qwen3-32B-FP8\", \"Qwen3-14B\", \"Qwen3-14B-Base\", \"Qwen/Qwen3-14B-FP8\", \"Qwen3-8B\", \"Qwen3-8B-Base\", \"Qwen/Qwen3-8B-FP8\", \"Qwen3-4B\", \"Qwen3-4B-Base\", \"Qwen/Qwen3-4B-FP8\", \"Qwen3-1.7B\", \"Qwen3-1.7B-Base\", \"Qwen/Qwen3-1.7B-FP8\", \"Qwen3-0.6B\", \"Qwen3-0.6B-Base\", \"Qwen/Qwen3-0.6B-FP8\"] {isTemplate:true}\n",
|
||||
"model_id = \"Qwen/\" + base_model_name\n",
|
||||
"hf_model_id = model_id\n",
|
||||
"\n",
|
||||
@@ -253,11 +253,14 @@
|
||||
" resource_id = \"custom_model_serving_preemptible_nvidia_h100_gpus\"\n",
|
||||
" else:\n",
|
||||
" resource_id = \"custom_model_serving_nvidia_h100_gpus\"\n",
|
||||
" if base_model_name in [\"Qwen3-235B-A22B\"]:\n",
|
||||
" if base_model_name in [\"Qwen3-235B-A22B\", \"Qwen3-235B-A22B-Instruct-2507\"]:\n",
|
||||
" machine_type = \"a3-highgpu-8g\"\n",
|
||||
" accelerator_count = 8\n",
|
||||
" model_id = \"gs://vertex-model-garden-restricted-us/qwen3/Qwen3-235B-A22B\"\n",
|
||||
" elif base_model_name in [\"Qwen3-235B-A22B-FP8\"]:\n",
|
||||
" model_id = f\"gs://vertex-model-garden-restricted-us/qwen3/{base_model_name}\"\n",
|
||||
" elif base_model_name in [\n",
|
||||
" \"Qwen3-235B-A22B-FP8\",\n",
|
||||
" \"Qwen3-235B-A22B-Instruct-2507-FP8\",\n",
|
||||
" ]:\n",
|
||||
" machine_type = \"a3-highgpu-4g\"\n",
|
||||
" accelerator_count = 4\n",
|
||||
" else:\n",
|
||||
@@ -268,8 +271,13 @@
|
||||
" resource_id = \"custom_model_serving_preemptible_nvidia_l4_gpus\"\n",
|
||||
" else:\n",
|
||||
" resource_id = \"custom_model_serving_nvidia_l4_gpus\"\n",
|
||||
" if base_model_name in [\"Qwen3-235B-A22B\", \"Qwen3-235B-A22B-FP8\"]:\n",
|
||||
" raise ValueError(\"L4s are insufficient to server Qwen3-235B-A22B.\")\n",
|
||||
" if base_model_name in [\n",
|
||||
" \"Qwen3-235B-A22B\",\n",
|
||||
" \"Qwen3-235B-A22B-FP8\",\n",
|
||||
" \"Qwen3-235B-A22B-Instruct-2507\",\n",
|
||||
" \"Qwen3-235B-A22B-Instruct-2507-FP8\",\n",
|
||||
" ]:\n",
|
||||
" raise ValueError(\"L4s are insufficient to serve Qwen3-235B-A22B models.\")\n",
|
||||
" elif base_model_name in [\"Qwen3-30B-A3B\", \"Qwen3-30B-A3B-Base\", \"Qwen3-32B\"]:\n",
|
||||
" machine_type = \"g2-standard-48\"\n",
|
||||
" accelerator_count = 4\n",
|
||||
|
||||
Reference in New Issue
Block a user