Spaces:

Dovakiins
/

qwerrwe

Build error

App Files Files Community

winglian commited on Oct 28, 2023

Commit

8b79ff0

unverified ·

1 Parent(s): 0800885

fix eval_steps to be a sane default (#797)

Browse files

* fix eval_steps to be a sane default

* update docs for fractional eval_steps

Files changed (23) hide show

README.md +2 -2
examples/cerebras/qlora.yml +1 -1
examples/code-llama/13b/lora.yml +2 -2
examples/code-llama/13b/qlora.yml +2 -2
examples/code-llama/34b/lora.yml +2 -2
examples/code-llama/34b/qlora.yml +2 -2
examples/code-llama/7b/lora.yml +2 -2
examples/code-llama/7b/qlora.yml +2 -2
examples/falcon/config-7b-qlora.yml +1 -1
examples/gptj/qlora.yml +1 -1
examples/jeopardy-bot/config.yml +1 -1
examples/llama-2/gptq-lora.yml +1 -1
examples/llama-2/lora.yml +2 -2
examples/llama-2/qlora.yml +2 -2
examples/llama-2/relora.yml +2 -2
examples/llama-2/tiny-llama.yml +2 -2
examples/mistral/config.yml +2 -2
examples/mistral/qlora.yml +1 -1
examples/mpt-7b/config.yml +1 -1
examples/pythia/lora.yml +2 -2
examples/redpajama/config-3b.yml +1 -1
examples/replit-3b/config-lora.yml +1 -1
examples/xgen-7b/xgen-7b-8k-qlora.yml +1 -1

README.md CHANGED Viewed

@@ -618,14 +618,14 @@ gradient_accumulation_steps: 1
 # The number of samples to include in each batch. This is the number of samples sent to each GPU.
 micro_batch_size: 2
 eval_batch_size:
-num_epochs: 3
 warmup_steps: 100
 learning_rate: 0.00003
 lr_quadratic_warmup:
 logging_steps:
 save_strategy: # Set to `no` to skip checkpoint saves
 save_steps: # Leave empty to save at each epoch
-eval_steps: # Leave empty to eval at each epoch
 save_total_limit: # Checkpoints saved at a time
 # Maximum number of iterations to train for. It precedes num_epochs which means that
 # if both are set, num_epochs will not be guaranteed.

 # The number of samples to include in each batch. This is the number of samples sent to each GPU.
 micro_batch_size: 2
 eval_batch_size:
+num_epochs: 4
 warmup_steps: 100
 learning_rate: 0.00003
 lr_quadratic_warmup:
 logging_steps:
 save_strategy: # Set to `no` to skip checkpoint saves
 save_steps: # Leave empty to save at each epoch
+eval_steps: # Leave empty to eval at each epoch, integers for every N steps. decimal for fraction of total steps
 save_total_limit: # Checkpoints saved at a time
 # Maximum number of iterations to train for. It precedes num_epochs which means that
 # if both are set, num_epochs will not be guaranteed.

examples/cerebras/qlora.yml CHANGED Viewed

@@ -49,7 +49,7 @@ flash_attention:
 gptq_groupsize:
 gptq_model_v1:
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gptq_groupsize:
 gptq_model_v1:
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/13b/lora.yml CHANGED Viewed

@@ -34,7 +34,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -54,7 +54,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/13b/qlora.yml CHANGED Viewed

@@ -36,7 +36,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -56,7 +56,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/34b/lora.yml CHANGED Viewed

@@ -34,7 +34,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -54,7 +54,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/34b/qlora.yml CHANGED Viewed

@@ -36,7 +36,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -56,7 +56,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/7b/lora.yml CHANGED Viewed

@@ -34,7 +34,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -54,7 +54,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/code-llama/7b/qlora.yml CHANGED Viewed

@@ -36,7 +36,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -56,7 +56,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/falcon/config-7b-qlora.yml CHANGED Viewed

@@ -53,7 +53,7 @@ output_dir: ./qlora-out
 # decrease if OOM, increase for max VRAM utilization
 micro_batch_size: 1
 gradient_accumulation_steps: 2
-num_epochs: 3
 # Optimizer for QLoRA
 optimizer: paged_adamw_32bit
 torchdistx_path:

 # decrease if OOM, increase for max VRAM utilization
 micro_batch_size: 1
 gradient_accumulation_steps: 2
+num_epochs: 4
 # Optimizer for QLoRA
 optimizer: paged_adamw_32bit
 torchdistx_path:

examples/gptj/qlora.yml CHANGED Viewed

@@ -46,7 +46,7 @@ flash_attention:
 gptq_groupsize:
 gptq_model_v1:
 warmup_steps: 10
-eval_steps: 20
 save_steps:
 debug:
 deepspeed:

 gptq_groupsize:
 gptq_model_v1:
 warmup_steps: 10
+eval_steps: 0.05
 save_steps:
 debug:
 deepspeed:

examples/jeopardy-bot/config.yml CHANGED Viewed

@@ -24,7 +24,7 @@ wandb_log_model:
 output_dir: ./jeopardy-bot-7b
 gradient_accumulation_steps: 1
 micro_batch_size: 1
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

 output_dir: ./jeopardy-bot-7b
 gradient_accumulation_steps: 1
 micro_batch_size: 1
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

examples/llama-2/gptq-lora.yml CHANGED Viewed

@@ -37,7 +37,7 @@ wandb_log_model:
 output_dir: ./model-out
 gradient_accumulation_steps: 1
 micro_batch_size: 1
-num_epochs: 3
 optimizer: adamw_torch
 adam_beta2: 0.95
 adam_eps: 0.00001

 output_dir: ./model-out
 gradient_accumulation_steps: 1
 micro_batch_size: 1
+num_epochs: 4
 optimizer: adamw_torch
 adam_beta2: 0.95
 adam_eps: 0.00001

examples/llama-2/lora.yml CHANGED Viewed

@@ -34,7 +34,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -54,7 +54,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

examples/llama-2/qlora.yml CHANGED Viewed

@@ -36,7 +36,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -56,7 +56,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 eval_table_size:
 save_steps:
 debug:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: paged_adamw_32bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 eval_table_size:
 save_steps:
 debug:

examples/llama-2/relora.yml CHANGED Viewed

@@ -40,7 +40,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 4
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -60,7 +60,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 save_steps: 50
 debug:
 deepspeed:

 gradient_accumulation_steps: 4
 micro_batch_size: 4
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 save_steps: 50
 debug:
 deepspeed:

examples/llama-2/tiny-llama.yml CHANGED Viewed

@@ -34,7 +34,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
@@ -54,7 +54,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 eval_table_size:
 save_steps:
 debug:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.0002
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 eval_table_size:
 save_steps:
 debug:

examples/mistral/config.yml CHANGED Viewed

@@ -26,7 +26,7 @@ wandb_log_model:
 gradient_accumulation_steps: 4
 micro_batch_size: 2
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.000005
@@ -46,7 +46,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

 gradient_accumulation_steps: 4
 micro_batch_size: 2
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 lr_scheduler: cosine
 learning_rate: 0.000005
 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

examples/mistral/qlora.yml CHANGED Viewed

@@ -63,7 +63,7 @@ xformers_attention:
 flash_attention: true
 warmup_steps: 10
-eval_steps: 20
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

 flash_attention: true
 warmup_steps: 10
+eval_steps: 0.05
 eval_table_size:
 eval_table_max_new_tokens: 128
 save_steps:

examples/mpt-7b/config.yml CHANGED Viewed

@@ -26,7 +26,7 @@ wandb_log_model:
 output_dir: ./mpt-alpaca-7b
 gradient_accumulation_steps: 1
 micro_batch_size: 1
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

 output_dir: ./mpt-alpaca-7b
 gradient_accumulation_steps: 1
 micro_batch_size: 1
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

examples/pythia/lora.yml CHANGED Viewed

@@ -23,7 +23,7 @@ wandb_log_model:
 output_dir: ./lora-alpaca-pythia
 gradient_accumulation_steps: 1
 micro_batch_size: 4
-num_epochs: 3
 learning_rate: 0.00001
 train_on_inputs: false
 group_by_length: false
@@ -33,5 +33,5 @@ early_stopping_patience:
 resume_from_checkpoint:
 local_rank:
 weight_decay: 0.1
-eval_steps: 20
 logging_steps: 1

 output_dir: ./lora-alpaca-pythia
 gradient_accumulation_steps: 1
 micro_batch_size: 4
+num_epochs: 4
 learning_rate: 0.00001
 train_on_inputs: false
 group_by_length: false
 resume_from_checkpoint:
 local_rank:
 weight_decay: 0.1
+eval_steps: 0.05
 logging_steps: 1

examples/redpajama/config-3b.yml CHANGED Viewed

@@ -27,7 +27,7 @@ wandb_log_model:
 output_dir: ./redpajama-alpaca-3b
 batch_size: 4
 micro_batch_size: 1
-num_epochs: 3
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

 output_dir: ./redpajama-alpaca-3b
 batch_size: 4
 micro_batch_size: 1
+num_epochs: 4
 optimizer: adamw_bnb_8bit
 torchdistx_path:
 lr_scheduler: cosine

examples/replit-3b/config-lora.yml CHANGED Viewed

@@ -26,7 +26,7 @@ wandb_log_model:
 output_dir: ./lora-replit
 batch_size: 8
 micro_batch_size: 1
-num_epochs: 3
 optimizer:
 torchdistx_path:
 lr_scheduler:

 output_dir: ./lora-replit
 batch_size: 8
 micro_batch_size: 1
+num_epochs: 4
 optimizer:
 torchdistx_path:
 lr_scheduler:

examples/xgen-7b/xgen-7b-8k-qlora.yml CHANGED Viewed

@@ -51,7 +51,7 @@ output_dir: ./qlora-out
 # decrease if OOM, increase for max VRAM utilization
 micro_batch_size: 1
 gradient_accumulation_steps: 1
-num_epochs: 3
 # Optimizer for QLoRA
 optimizer: paged_adamw_32bit
 torchdistx_path:

 # decrease if OOM, increase for max VRAM utilization
 micro_batch_size: 1
 gradient_accumulation_steps: 1
+num_epochs: 4
 # Optimizer for QLoRA
 optimizer: paged_adamw_32bit
 torchdistx_path: