Cybercode
tecnoblog
tecnoblog
Tecnologia · · 2 min de leitura ·

DeepSeek trabalha em “tokens visuais” para melhorar memória de IAs

DeepSeek trabalha em "tokens visuais" para melhorar memória de IAs

DeepSeek desenvolveu um método que transforma texto em imagens para otimizar a memória de modelos de inteligência artificial.

O sistema usa menos tokens e ajuda a evitar o “context rot”, quando a IA perde a coerência das interações.

A empresa chinesa de inteligência artificial DeepSeek está trocando os tradicionais tokens de texto por “tokens visuais”, armazenando informações escritas como imagens compactadas. A ideia é que a técnica possa melhorar a capacidade de memória dos modelos de IA da companhia.

A abordagem, explicada em uma pesquisa publicada neste mês, foi testada em um novo modelo de Reconhecimento Óptico de Caracteres (OCR), que permite que o sistema retenha quase a mesma quantidade de informação usando menos tokens.

Essencialmente, a solução “tira uma foto” das páginas e armazena a informação como imagem. O método também usa compressão em camadas: dados mais antigos ficam “levemente borrados” para economizar espaço, mas sem perder a acessibilidade. Os códigos e os pesos de treinamento estão disponíveis no GitHub.

Diagrama de arquitetura do modelo DeepSeek-OCR, um modelo multimodal para Reconhecimento Óptico de Caracteres (OCR) e modelagem de documentos. O fluxo começa com a 'Input' (Entrada) de um documento, que é dividido em $n times 16 times 16$ patches. O processo de Tokenizer utiliza um bloco SAM (Segment Anything Model) e ViTDet 80M (para atenção local), seguido por uma camada de Conv (Convolução) para down-sample e gerar $n/16$ vision tokens. Estes tokens passam pelo DeepEncoder, que utiliza um bloco CLIP ViT 300M (para atenção global), gerando um Embedding layer. A saída do DeepEncoder é combinada (símbolo $oplus$) com um Prompt para ser processada pelo Decoder, que é o modelo de linguagem grande DeepSeek-3B (MOE-A570M), produzindo a 'Output' (Saída) final dos tokens reconhecidos.
Novos tokens da DeepSeek comprimem informação em imagem (imagem: reprodução/DeepSeek)

Atualmente, os LLMs quebram textos em milhares de unidades (tokens), um método que se torna caro em processamento à medida que as conversas se alongam. Isso causa o “context rot” (apodrecimento do contexto), fazendo a IA “esquecer” o início da interação e perder a coerência.

Fonte: Tecnoblog

Publicidade