研究人员提出让语言模型处理字符的 byteification 方法——《自然》
研究人员描述了一种名为 byteification 的方法,用于让基于词元运行的大型语言模型能够在字节层面处理文本,《自然》报道。这使得此类模型能够处理单词中的单个字符。
模型为何会出错
大多数大型语言模型将单词编码为词元,即字母或词的一部分组成的序列。这种方法能够在许多任务中取得较高表现,但无法直接访问被编码为二进制序列——字节——的单个字符。
更多最新消息请关注 UA.News Telegram 频道 Telegram.
因此,模型在统计字母时可能出错。例如,在 strawberry 一词中,字母 r 出现了三次,但许多大型语言模型回答为两次。
在字节层面工作
据《自然》指出,Minixhofer 及其合作者将 byteification 提出为一种让现有词元化模型适配字节层面工作的方式。作者展示了,经过这种改进后,模型能够展现出有竞争力的结果,同时保留读取单个字符的能力。