0.00.163.200 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) 0.00.164.229 W srv llama_server: ----------------- 0.00.164.231 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set 0.00.164.231 W srv llama_server: this can be a security risk (cross-origin attacks) 0.00.164.231 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.164.231 W srv llama_server: ----------------- 0.00.165.537 I srv load_model: loading model '' 0.01.049.124 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --load-mode none for better performance 4.24.894.643 I cmn init: llama threadpool init, n_threads = 24 4.28.859.880 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 131072, kv_unified = 'false' 4.28.890.961 W srv init: chat template supports preserving reasoning, it is enabled by default (may use more tokens, disable via --no-reasoning-preserve) 4.28.891.032 I srv llama_server: model loaded 4.28.891.044 I srv llama_server: listening on http://127.0.0.1:8137 4.30.640.446 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1 4.30.640.483 I slot launch_slot_: id 0 | task 0 | processing task, is_child = 0 4.35.229.675 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 9, progress = 0.28, t = 4.59 s / 1.96 tokens per second 4.43.043.678 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 28, progress = 0.88, t = 12.40 s / 2.26 tokens per second 5.09.327.564 I slot print_timing: id 0 | task 0 | prompt eval time = 13485.07 ms / 32 tokens ( 421.41 ms per token, 2.37 tokens per second) 5.09.327.567 I slot print_timing: id 0 | task 0 | eval time = 25201.99 ms / 80 tokens ( 319.01 ms per token, 3.13 tokens per second) 5.09.327.567 I slot print_timing: id 0 | task 0 | total time = 38687.05 ms / 112 tokens 5.09.327.574 I slot print_timing: id 0 | task 0 | graphs reused = 0 5.09.350.191 I slot release: id 0 | task 0 | stop processing: n_tokens = 111, truncated = 0 5.09.379.451 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 139732578606 5.09.426.197 I slot launch_slot_: id 0 | task 83 | processing task, is_child = 0 5.24.543.210 I slot print_timing: id 0 | task 83 | prompt processing, n_tokens = 56, progress = 0.77, t = 15.12 s / 3.70 tokens per second 5.27.897.616 I slot print_timing: id 0 | task 83 | prompt processing, n_tokens = 69, progress = 0.95, t = 18.47 s / 3.74 tokens per second 5.33.981.127 I slot print_timing: id 0 | task 83 | prompt eval time = 19332.78 ms / 73 tokens ( 264.83 ms per token, 3.78 tokens per second) 5.33.981.129 I slot print_timing: id 0 | task 83 | eval time = 5222.13 ms / 18 tokens ( 307.18 ms per token, 3.26 tokens per second) 5.33.981.155 I slot print_timing: id 0 | task 83 | total time = 24554.90 ms / 91 tokens 5.33.981.156 I slot print_timing: id 0 | task 83 | graphs reused = 0 5.33.981.505 I slot release: id 0 | task 83 | stop processing: n_tokens = 90, truncated = 0 5.33.993.670 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 139757209919 5.34.038.215 I slot launch_slot_: id 0 | task 104 | processing task, is_child = 0 6.43.868.524 I slot print_timing: id 0 | task 104 | prompt processing, n_tokens = 1434, progress = 0.74, t = 69.83 s / 20.54 tokens per second 7.04.430.821 I slot print_timing: id 0 | task 104 | prompt processing, n_tokens = 1946, progress = 1.00, t = 90.39 s / 21.53 tokens per second 7.08.543.239 I slot print_timing: id 0 | task 104 | prompt eval time = 91211.12 ms / 1950 tokens ( 46.77 ms per token, 21.38 tokens per second) 7.08.543.242 I slot print_timing: id 0 | task 104 | eval time = 3293.87 ms / 12 tokens ( 299.44 ms per token, 3.34 tokens per second) 7.08.543.242 I slot print_timing: id 0 | task 104 | total time = 94505.00 ms / 1962 tokens 7.08.543.243 I slot print_timing: id 0 | task 104 | graphs reused = 0 7.08.543.605 I slot release: id 0 | task 104 | stop processing: n_tokens = 1961, truncated = 0 7.08.609.108 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, f_sim_best = 0.131 (> 0.100 thold), f_keep = 0.509 7.08.609.169 I slot launch_slot_: id 0 | task 120 | processing task, is_child = 0 8.26.119.400 I slot print_timing: id 0 | task 120 | prompt processing, n_tokens = 2048, progress = 0.27, t = 77.51 s / 26.42 tokens per second 9.43.833.211 I slot print_timing: id 0 | task 120 | prompt processing, n_tokens = 4096, progress = 0.54, t = 155.22 s / 26.39 tokens per second 11.00.650.749 I slot print_timing: id 0 | task 120 | prompt processing, n_tokens = 6144, progress = 0.80, t = 232.04 s / 26.48 tokens per second 11.37.583.064 I slot print_timing: id 0 | task 120 | prompt processing, n_tokens = 7125, progress = 0.93, t = 268.97 s / 26.49 tokens per second 11.57.424.292 I slot print_timing: id 0 | task 120 | prompt processing, n_tokens = 7637, progress = 1.00, t = 288.82 s / 26.44 tokens per second 12.01.357.448 I slot print_timing: id 0 | task 120 | prompt eval time = 289468.55 ms / 7641 tokens ( 37.88 ms per token, 26.40 tokens per second) 12.01.357.450 I slot print_timing: id 0 | task 120 | eval time = 3279.71 ms / 12 tokens ( 298.16 ms per token, 3.35 tokens per second) 12.01.357.451 I slot print_timing: id 0 | task 120 | total time = 292748.26 ms / 7653 tokens 12.01.357.452 I slot print_timing: id 0 | task 120 | graphs reused = 0 12.01.357.525 I slot release: id 0 | task 120 | stop processing: n_tokens = 7661, truncated = 0 12.01.417.435 I srv operator(): operator(): cleaning up before exit...