GEO & AEO — Busca por IA

SLM (Small Language Model)

Por Gustavo Bonato Abrão e Francis Trauer · Atualizado em 15 de julho de 2026

Definição

SLM, sigla de small language model, é um modelo de linguagem com poucos bilhões de parâmetros, usado para tarefas específicas e delimitadas com custo, latência e requisito de infraestrutura menores que os de um modelo de grande porte.

ClassificaçãoConceito
CategoriaGEO & AEO — Busca por IA
Também conhecido comoSmall Language Model · Modelo de Linguagem Pequeno
NívelAvançado

O que é SLM?

SLM é a sigla de small language model, traduzido como modelo de linguagem pequeno. O termo descreve modelos com contagem de parâmetros bem menor que a dos modelos de fronteira, tipicamente na casa de poucos bilhões, treinados para funcionar bem em escopos delimitados.

O parâmetro é o valor numérico que o modelo ajusta durante o treinamento. Um LLM de fronteira trabalha com contagens muito maiores e conhecimento mais amplo. O SLM abre mão dessa amplitude em troca de três ganhos: custo por resposta menor, latência menor e possibilidade de rodar em infraestrutura modesta.

A fronteira entre as categorias é móvel. O que hoje é considerado pequeno era estado da arte poucos anos atrás, e a classificação segue mudando conforme os modelos evoluem.

Como funciona na prática?

O SLM aparece em tarefas repetitivas e bem definidas: classificar mensagens de atendimento, extrair dados de formulários em texto livre, marcar sentimento em avaliações e gerar variações curtas de título. Nesses casos, o volume é alto e o repertório exigido é estreito.

Duas técnicas ampliam o alcance do modelo. O fine-tuning, ou ajuste fino, adapta o comportamento ao seu domínio e ao seu tom. O RAG fornece os fatos no momento da pergunta, o que compensa a base de conhecimento menor. O limite aparece em raciocínio complexo, tarefas abertas e instruções longas com muitas condições encadeadas, onde o modelo pequeno erra mais.

SLM vs LLM: qual a diferença?

AspectoSLMLLM de fronteira
EscalaPoucos bilhões de parâmetrosOrdens de grandeza maior
Custo por chamadaMenorMaior
Melhor usoTarefa repetitiva e delimitadaRaciocínio aberto e complexo

Veredito: o SLM entrega volume barato em escopo estreito, o LLM entrega amplitude em tarefas abertas.

Exemplos de uso

Uma operação de e-commerce recebe 5 mil mensagens por dia no atendimento. Um SLM classifica cada uma entre rastreio, troca, dúvida de produto e reclamação, e encaminha para a fila certa. A tarefa é fechada e o volume justifica o custo baixo por chamada.

Uma imobiliária transforma descrições escritas por corretores em campos de metragem, quartos e bairro. Um modelo pequeno com ajuste fino no vocabulário do setor dá conta do trabalho.

Perguntas frequentes sobre SLM

Quantos parâmetros tem um SLM?

Não existe corte oficial. A classificação é relativa e muda com o tempo, acompanhando a evolução dos modelos de fronteira. No uso corrente, o rótulo costuma se aplicar a modelos na casa de poucos bilhões de parâmetros, contra ordens de grandeza maiores nos modelos de ponta.

SLM serve para atendimento ao cliente?

Serve para partes do atendimento com escopo fechado, como classificar assunto, extrair dados e responder perguntas frequentes com base em uma base própria via RAG. Conversas abertas, negociação e casos delicados pedem avaliação cuidadosa antes de qualquer automação.

SLM roda sem internet?

Alguns modelos pequenos rodam localmente, em servidor próprio ou em dispositivos, sem chamada externa. Isso interessa a operações com requisito de privacidade ou de latência baixa. A viabilidade depende do modelo, do hardware disponível e do volume de requisições.

Termos relacionados

LLM (Large Language Model)

LLM é um modelo de inteligência artificial treinado com volumes enormes de texto para entender e gerar linguagem natural, usado como base de assistentes como ChatGPT e Gemini. Também chamado de Large Language Model ou Grande Modelo de Linguagem, ele sustenta as buscas generativas e as respostas de IA que citam marcas e sites.

RAG (Retrieval-Augmented Generation)

RAG é a técnica que combina recuperação de informação com geração de texto por IA, buscando documentos relevantes antes de redigir a resposta, usada para dar dados atuais e verificáveis aos modelos de linguagem e reduzir respostas inventadas.

Janela de Contexto

Janela de contexto é o limite de texto que um modelo de linguagem processa de uma só vez, medido em tokens, usado para determinar quanto conteúdo a IA consegue ler antes de responder. Quanto maior a janela, mais informação o modelo considera ao gerar uma resposta ou citar uma fonte.

Alucinação de IA

Alucinação de IA é a resposta em que um modelo de inteligência artificial apresenta informação falsa ou inventada com tom de certeza, usada como conceito-chave para entender os limites das respostas generativas e a necessidade de verificar dados críticos na fonte.

Embedding

Embedding é a representação numérica de um texto, imagem ou outro dado em forma de vetor, usada por sistemas de inteligência artificial para medir semelhança de significado e alimentar buscas semânticas, recomendações e respostas geradas por IA.

← Voltar ao glossário