Commit Graph
19 Commits
Author SHA1 Message Date
slarenandGitHub 8944a13296 Add NVIDIA cuBLAS support (#1044) 2023-04-19 11:22:45 +02:00
6667401238 Multi-threaded ggml_cpy (#1035)
* Multi-threaded ggml_cpy

* Update ggml.c

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>

* Also fix wdata offset in ggml_compute_forward_add_q_f32

---------

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
2023-04-19 00:53:24 +02:00
slarenandGitHub 315a95a4d3 Add LoRA support (#820) 2023-04-17 17:28:55 +02:00
slarenandGitHub 47f61aaa5f Fix: do not close file on mmap (#1017) 2023-04-16 21:27:38 +02:00
SlarenandPavol Rusnak 0d054e292e Show error message when -f fails 2023-04-01 16:08:40 +02:00
slarenandGitHub 1d08882afa Optimize AVX2 ggml_vec_dot_q4_0 (#642) 2023-03-31 15:55:52 +00:00
SlarenandJustine Tunney a017390358 Initial windows support (untested) 2023-03-30 12:28:25 -07:00
SlarenandJustine Tunney ac184d5147 Always initialize mm_addr and mm_length in llama_model 2023-03-30 12:28:25 -07:00
SlarenandJustine Tunney 276e5b7811 Unmap the file in llama_free 2023-03-30 12:28:25 -07:00
SlarenandJustine Tunney d68c5dc435 Make mmap_file static 2023-03-30 12:28:25 -07:00
SlarenandJustine Tunney 64bde3ffd4 Fix ggml_init_params in quantize 2023-03-30 12:28:25 -07:00
SlarenandJustine Tunney c03ae8dca1 Add mmap support for model files 2023-03-30 12:28:25 -07:00
slarenandGitHub ed3c680bcd Fix GGML_F32Cx8_STORE in AVX without F16C path (#619) 2023-03-30 11:16:30 +02:00
2a98bc18ea ggml : add AVX2 implementation of quantize_row_q4_1 (#515)
* Add AVX2 implementation of quantize_row_q4_1

* Actually use AVX2

* Make quantize_row_q4_1 static

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>

---------

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
2023-03-28 21:06:03 +03:00
slarenandGitHub a6bdc47cba Fix usage of F16C intrinsics in AVX code (#563)
* Fix usage of F16C intrinsics in AVX code when F16C is not defined
2023-03-28 17:26:55 +03:00
slarenandGitHub 459e93cce0 Add AVX2 implementation of dequantize_row_q4_1 (#505) 2023-03-25 20:31:48 +02:00
slarenandGitHub 09aecbf628 Add AVX2 implementation of dequantize_row_q4_0 (#467) 2023-03-25 17:06:49 +02:00
slarenandGitHub 29b7baab67 Add timings for the prompt evaluation (#478) 2023-03-25 16:34:23 +02:00
50fae10d03 Add --ignore-eos parameter (#181)
Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
2023-03-19 20:22:48 +02:00