NVIDIA wydała nowe sterowniki w wersji R555, twierdząc, że zwiększają “wydajność AI” do 3x na kartach RTX

    Tak, tak, krzykliwe tytuły często upadają na twarz, jednak tym razem NVIDIA naprawdę poprawia “wydajność AI” trzykrotnie. Oczywiście istnieją pewne zastrzeżenia, takie jak to, co dokładnie oznacza wydajność AI? Wyniki firmy NVIDIA wykorzystują wydajność wnioskowania do pomiaru liczby tokenów na sekundę (dane na żywo), które model sztucznej inteligencji może odczytać (z podpowiedzi) i wyprowadzić (udzielić odpowiedzi).

    Wykres wydajności NVIDIA wykorzystuje ONNX ORT. ONNX to konsorcjum AI wspierane przez prawie każdą dużą korporację, która chce mocno wdrożyć sztuczną inteligencję w swoim stosie technologicznym. Wszystkich partnerów ONNX można znaleźć tutaj. ORT to skrót od ONNX Runtime i jest to, jak można się domyślić, środowisko uruchomieniowe, na którym można uruchamiać różne LLM. Można zauważyć, że NVIDIA przetestowała trzy różne LLM, Llama 2 7B firmy Meta, Mistral 7B i Phi-3-mini-4k Microsoftu. Wszystkie maszyny LLM są dostępne na zasadach open source, więc można je pobrać i przetestować w określonym celu.

    Jak widać, NVIDIA użyła czterech różnych wersji sterowników, różniących się odcieniami zieleni. Wydajność 3X wynika z wyników sterownika FP16-R550 w porównaniu ze sterownikiem Int4 R555. Ale tutaj pojawia się zastrzeżenie. Nowy sterownik wykorzystuje kwantyzację Int4. Kwantyzacja polega na uproszczeniu danych w LLM, dzięki czemu zajmują one mniej miejsca i wymagają mniej pamięci GPU do działania. Zwiększa to wydajność, ale może prowadzić do niedokładności w danych wyjściowych. Dzieje się tak dlatego, że bez kwantyzacji ( FP32 ) lub z niewielką kwantyzacją (FP16) dane są tak samo dokładne i nie podlegają żadnej transformacji. Przełączając się na kwantyzację Int8 lub Int4, usuwasz zmiennoprzecinkową (FP), co jest oszczędnością miejsca, o której mówiliśmy.

    Zyskujesz więc na wydajności, ale odbywa się to kosztem dokładności. Podczas korzystania z RTX Chat lub uruchamiania LLM w niewielkim czasie, może to być zgrabny sposób na zaoszczędzenie jak największej ilości zasobów GPU, dzięki czemu można również grać, podczas gdy sztuczna inteligencja robi swoje. Nieumyślnie doprowadzi to również do obecności lokalnych LLM w urządzeniach mobilnych, co wydaje się być kolejnym krokiem dla wielu producentów.

    Subskrybuj
    Powiadomienie o
    guest
    0 Comments
    Opinie w tekście
    Zobacz wszystkie komentarze