0.00.057.577 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) 0.00.057.829 W srv llama_server: ----------------- 0.00.057.830 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set 0.00.057.830 W srv llama_server: this can be a security risk (cross-origin attacks) 0.00.057.830 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.057.830 W srv llama_server: ----------------- 0.00.059.087 I srv load_model: loading model '/MiniMax-M2.7-UD-IQ4_XS-00001-of-00004.gguf' 0.00.642.813 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --load-mode none for better performance 0.02.676.470 I cmn init: llama threadpool init, n_threads = 24 0.03.020.794 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 131072, kv_unified = 'false' 0.03.029.541 I srv llama_server: model loaded 0.03.029.548 I srv llama_server: listening on http://127.0.0.1:8131 0.05.154.732 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1 0.05.154.792 I slot launch_slot_: id 0 | task 0 | processing task, is_child = 0 0.11.466.471 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 4096, progress = 0.05, t = 6.31 s / 648.96 tokens per second 0.17.061.267 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 8192, progress = 0.10, t = 11.91 s / 688.03 tokens per second 0.22.704.875 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 12288, progress = 0.14, t = 17.55 s / 700.17 tokens per second 0.28.384.383 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 16384, progress = 0.19, t = 23.23 s / 705.31 tokens per second 0.34.181.936 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 20480, progress = 0.24, t = 29.03 s / 705.55 tokens per second 0.40.094.540 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 24576, progress = 0.29, t = 34.94 s / 703.38 tokens per second 0.46.223.128 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 28672, progress = 0.33, t = 41.07 s / 698.15 tokens per second 0.52.454.795 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 32768, progress = 0.38, t = 47.30 s / 692.77 tokens per second 0.58.830.589 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 36864, progress = 0.43, t = 53.68 s / 686.79 tokens per second 1.05.382.735 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 40960, progress = 0.48, t = 60.23 s / 680.08 tokens per second 1.12.161.314 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 45056, progress = 0.53, t = 67.01 s / 672.41 tokens per second 1.19.170.839 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 49152, progress = 0.57, t = 74.02 s / 664.07 tokens per second 1.26.187.155 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 53248, progress = 0.62, t = 81.03 s / 657.12 tokens per second 1.33.335.879 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 57344, progress = 0.67, t = 88.18 s / 650.30 tokens per second 1.40.743.534 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 61440, progress = 0.72, t = 95.59 s / 642.75 tokens per second 1.48.380.606 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 65536, progress = 0.76, t = 103.23 s / 634.88 tokens per second 1.56.318.883 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 69632, progress = 0.81, t = 111.16 s / 626.39 tokens per second 2.04.487.419 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 73728, progress = 0.86, t = 119.33 s / 617.84 tokens per second 2.12.947.882 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 77824, progress = 0.91, t = 127.79 s / 608.98 tokens per second 2.21.682.957 I slot print_timing: id 0 | task 0 | prompt processing, n_tokens = 81920, progress = 0.96, t = 136.53 s / 600.02 tokens per second 2.32.500.120 I slot print_timing: id 0 | task 0 | prompt eval time = 145476.38 ms / 85763 tokens ( 1.70 ms per token, 589.53 tokens per second) 2.32.500.122 I slot print_timing: id 0 | task 0 | eval time = 1868.91 ms / 16 tokens ( 124.59 ms per token, 8.03 tokens per second) 2.32.500.123 I slot print_timing: id 0 | task 0 | total time = 147345.30 ms / 85779 tokens 2.32.500.128 I slot print_timing: id 0 | task 0 | graphs reused = 15 2.32.501.359 I slot release: id 0 | task 0 | stop processing: n_tokens = 85778, truncated = 0 2.35.591.207 I srv operator(): operator(): cleaning up before exit... 0.00.027.741 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg) 0.00.028.204 W srv llama_server: ----------------- 0.00.028.205 W srv llama_server: CORS is set to allow all origins ('*') and no API key is set 0.00.028.205 W srv llama_server: this can be a security risk (cross-origin attacks) 0.00.028.205 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.028.205 W srv llama_server: ----------------- 0.00.029.435 I srv load_model: loading model '/MiniMax-M2.7-UD-IQ4_XS-00001-of-00004.gguf' 0.00.610.233 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --load-mode none for better performance 0.02.604.192 I cmn init: llama threadpool init, n_threads = 24 0.02.936.951 I srv load_model: initializing, n_slots = 1, n_ctx_slot = 131072, kv_unified = 'false' 0.02.945.693 I srv llama_server: model loaded 0.02.945.698 I srv llama_server: listening on http://127.0.0.1:8131 0.07.309.550 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, f_sim_best = 1.000 (> 0.100 thold), f_keep = 1.000 0.07.309.598 I slot launch_slot_: id 0 | task 1 | processing task, is_child = 0 0.07.309.637 W slot operator(): id 0 | task 1 | need to evaluate at least 1 token for each active slot (n_past = 85763, task.n_tokens() = 85763) 0.07.309.637 W slot operator(): id 0 | task 1 | n_past was set to 85762 0.09.343.185 I slot print_timing: id 0 | task 1 | prompt eval time = 154.05 ms / 1 tokens ( 154.05 ms per token, 6.49 tokens per second) 0.09.343.188 I slot print_timing: id 0 | task 1 | eval time = 1879.51 ms / 16 tokens ( 125.30 ms per token, 7.98 tokens per second) 0.09.343.188 I slot print_timing: id 0 | task 1 | total time = 2033.56 ms / 17 tokens 0.09.343.192 I slot print_timing: id 0 | task 1 | graphs reused = 16 0.09.344.065 I slot release: id 0 | task 1 | stop processing: n_tokens = 85778, truncated = 0 0.09.352.718 I srv operator(): operator(): cleaning up before exit...