Update README.md

Files changed (1) hide show

README.md CHANGED Viewed

@@ -305,7 +305,7 @@ python benchmarks/benchmark_latency.py --input-len 256 --output-len 256 --model
 ### float8dq
 ```Shell
-python benchmarks/benchmark_latency.py --input-len 256 --output-len 256 --model pytorch/Phi-4-mini-instruct-float8dq --batch-size 1
 ```
 ## benchmark_serving
@@ -333,7 +333,7 @@ vllm serve pytorch/Phi-4-mini-instruct-float8dq --tokenizer microsoft/Phi-4-mini
 Client:
 ```Shell
-python benchmarks/benchmark_serving.py --backend vllm --dataset-name sharegpt --tokenizer microsoft/Phi-4-mini-instruct --dataset-path ./ShareGPT_V3_unfiltered_cleaned_split.json --model jerryzh168/phi4-mini-float8dq --num-prompts 1
 ```
 # Disclaimer

 ### float8dq
 ```Shell
+VLLM_DISABLE_COMPILE_CACHE=1 python benchmarks/benchmark_latency.py --input-len 256 --output-len 256 --model pytorch/Phi-4-mini-instruct-float8dq --batch-size 1
 ```
 ## benchmark_serving
 Client:
 ```Shell
+VLLM_DISABLE_COMPILE_CACHE=1 python benchmarks/benchmark_serving.py --backend vllm --dataset-name sharegpt --tokenizer microsoft/Phi-4-mini-instruct --dataset-path ./ShareGPT_V3_unfiltered_cleaned_split.json --model jerryzh168/phi4-mini-float8dq --num-prompts 1
 ```
 # Disclaimer