Zaznacz stronę
KVBoost: szybsze LLM dzięki ponownemu użyciu cache KV

KVBoost: szybsze LLM dzięki ponownemu użyciu cache KV

KVBoost to system wielokrotnego użycia pamięci podręcznej klucz-wartość dla dużych modeli językowych, który działa niezależnie od pozycji współdzielonej treści w prompcie. Dzięki podwójnemu schematowi hashowania redukuje opóźnienia prefill bez ograniczeń tradycyjnych...
AgentKVShift: wydajne ponowne użycie pamięci KV w agentach LLM

AgentKVShift: wydajne ponowne użycie pamięci KV w agentach LLM

Naukowcy opracowali metodę AgentKVShift, która bez dodatkowego trenowania redukuje koszty wnioskowania w agentowych systemach pamięci LLM poprzez inteligentne ponowne wykorzystanie stanów KV. Rozwiązanie eliminuje konieczność pełnego re-enkodowania ustrukturyzowanych...