0.00.168.650 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) 0.00.168.874 W srv llama_server: ----------------- 0.00.168.875 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set 0.00.168.875 W srv llama_server: this can be a security risk (cross-origin attacks) 0.00.168.875 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.168.875 W srv llama_server: ----------------- 0.00.170.229 I srv load_model: loading model '' 0.01.032.618 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --load-mode none for better performance 1.31.212.230 I cmn init: llama threadpool init, n_threads = 24 1.34.564.926 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 131072, kv_unified = 'false' 1.34.590.473 W srv init: chat template supports preserving reasoning, it is enabled by default (may use more tokens, disable via --no-reasoning-preserve) 1.34.590.523 I srv llama_server: model loaded 1.34.590.526 I srv llama_server: listening on http://127.0.0.1:8137 1.36.504.936 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1 1.36.505.031 I slot launch_slot_: id 0 | task 0 | processing task, is_child = 0 1.41.212.637 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 9, progress = 0.28, t = 4.71 s / 1.91 tokens per second 1.52.424.835 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 28, progress = 0.88, t = 15.92 s / 1.76 tokens per second 2.14.062.222 I slot print_timing: id 0 | task 0 | prompt eval time = 17132.80 ms / 32 tokens ( 535.40 ms per token, 1.87 tokens per second) 2.14.062.226 I slot print_timing: id 0 | task 0 | eval time = 20424.35 ms / 71 tokens ( 291.78 ms per token, 3.43 tokens per second) 2.14.062.226 I slot print_timing: id 0 | task 0 | total time = 37557.15 ms / 103 tokens 2.14.062.231 I slot print_timing: id 0 | task 0 | graphs reused = 0 2.14.062.474 I slot release: id 0 | task 0 | stop processing: n_tokens = 102, truncated = 0 2.14.076.118 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 139295704053 2.14.113.631 I slot launch_slot_: id 0 | task 74 | processing task, is_child = 0 2.26.925.912 I slot print_timing: id 0 | task 74 | prompt processing, n_tokens = 56, progress = 0.77, t = 12.81 s / 4.37 tokens per second 2.28.594.983 I slot print_timing: id 0 | task 74 | prompt processing, n_tokens = 69, progress = 0.95, t = 14.48 s / 4.76 tokens per second 2.32.522.868 I slot print_timing: id 0 | task 74 | prompt eval time = 14993.52 ms / 73 tokens ( 205.39 ms per token, 4.87 tokens per second) 2.32.522.873 I slot print_timing: id 0 | task 74 | eval time = 3414.75 ms / 18 tokens ( 200.87 ms per token, 4.98 tokens per second) 2.32.522.895 I slot print_timing: id 0 | task 74 | total time = 18408.27 ms / 91 tokens 2.32.522.898 I slot print_timing: id 0 | task 74 | graphs reused = 0 2.32.524.314 I slot release: id 0 | task 74 | stop processing: n_tokens = 90, truncated = 0 2.32.547.460 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 139314165892 2.32.614.436 I slot launch_slot_: id 0 | task 95 | processing task, is_child = 0 3.56.189.597 I slot print_timing: id 0 | task 95 | prompt processing, n_tokens = 1434, progress = 0.74, t = 83.57 s / 17.16 tokens per second 4.08.969.640 I slot print_timing: id 0 | task 95 | prompt processing, n_tokens = 1946, progress = 1.00, t = 96.36 s / 20.20 tokens per second 4.12.259.951 I slot print_timing: id 0 | task 95 | prompt eval time = 97278.22 ms / 1950 tokens ( 49.89 ms per token, 20.05 tokens per second) 4.12.259.955 I slot print_timing: id 0 | task 95 | eval time = 2367.23 ms / 12 tokens ( 215.20 ms per token, 4.65 tokens per second) 4.12.259.955 I slot print_timing: id 0 | task 95 | total time = 99645.45 ms / 1962 tokens 4.12.259.956 I slot print_timing: id 0 | task 95 | graphs reused = 0 4.12.261.623 I slot release: id 0 | task 95 | stop processing: n_tokens = 1961, truncated = 0 4.12.308.375 I srv operator(): operator(): cleaning up before exit...