Files
llama_cpp/ggml/src
Aman GuptaandGitHub b94050e896 CUDA: use LRU based eviction for cuda graphs (#21611)
* CUDA: use a ring-buffer for cuda graphs

* bump limit to 128

* use LRU eviction

* better naming

* do periodic clean-up
2026-04-17 23:24:21 +08:00
..
2026-04-14 17:32:58 +03:00
2026-04-16 17:21:28 +08:00
2026-04-16 17:21:28 +08:00
2026-03-25 12:53:16 +02:00