Badacze przedstawili byteification do pracy modeli językowych ze znakami — Nature
Badacze opisali podejście byteification, które dostosowuje duże modele językowe działające na tokenach do przetwarzania tekstu na poziomie bajtów, informuje Nature. Umożliwia to takim modelom pracę z pojedynczymi znakami w słowach.
Dlaczego modele popełniają błędy
Większość dużych modeli językowych koduje słowa jako tokeny — sekwencje liter lub części słów. Takie podejście pozwala osiągać dobre wyniki w wielu zadaniach, ale nie zapewnia bezpośredniego dostępu do pojedynczych znaków zakodowanych w sekwencjach binarnych — bajtach.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Z tego powodu modele mogą popełniać błędy przy liczeniu liter. Na przykład litera r występuje w słowie strawberry trzy razy, choć wiele dużych modeli językowych odpowiada, że dwa razy.
Praca na poziomie bajtów
Jak zauważa Nature, Minixhofer i współautorzy przedstawili byteification jako sposób na udoskonalenie istniejących tokenizowanych modeli do pracy na poziomie bajtów. Autorzy pokazali, że modele po takim udoskonaleniu mogą osiągać konkurencyjne wyniki, zachowując jednocześnie zdolność odczytywania pojedynczych znaków.
Czytaj nas na Telegram i Sends