Uso de tokens do assistente

Toda interação com a Filipa consome tokens do provedor de IA, e o Vendelo registra esse consumo. A tela Uso de tokens do assistente lista cada execução de IA da empresa (conversas, geração de arquivos e agentes) com usuário, provedor, modelo, tokens de entrada, de saída e de cache, e um diagnóstico de como a execução terminou, para que gestores e administradores acompanhem o uso, identifiquem padrões e dimensionem o orçamento. Este artigo explica o que é um token, o que cada coluna significa, como filtrar e exportar, e como interpretar os números.

O que são tokens

Token é a unidade que os provedores de IA usam para medir texto: aproximadamente três quartos de uma palavra em português. Cada pedido à Filipa envia tokens ao modelo (entrada: a sua pergunta, o histórico da conversa, as instruções e os dados consultados no Vendelo) e recebe tokens de volta (saída: a resposta, os relatórios visuais e as chamadas de consulta). Os provedores cobram por tokens, com preços diferentes para entrada e saída e para cada modelo.

Uma pergunta simples pode consumir poucos milhares de tokens de entrada, porque as instruções e o esquema de dados do Vendelo acompanham cada pedido. Isso é normal e esperado.

Onde fica e quem vê

Abra Filipa IA, Assistente, Uso de tokens do assistente. A tela exige a permissão Interações com a assistente de IA no perfil (ou usuário master) e a função “Conversas interativas com a Filipa” ligada. Ela mostra o consumo de todos os usuários da empresa.

Tela: lista uso tokens assistente v2 (computador)
Lista de uso de tokens do assistente com usuário, provedor, modelo, tokens, cache, diagnóstico e finalidade

Colunas da lista

ColunaConteúdo
Data de criaçãoData e hora da execução.
UsuárioQuem fez o pedido (nos agentes, o proprietário do agente). É calculado na hora da consulta, por isso não aceita filtro nem ordenação.
ProvedorProvedor de IA usado na execução.
ModeloModelo de IA que respondeu.
Tokens entrada / Tokens saídaTokens enviados ao modelo e gerados por ele.
Tokens lidos do cache / Tokens gravados no cacheParte da entrada que o provedor reaproveitou do cache (mais barata) e a que foi gravada no cache para as próximas chamadas.
InferênciasQuantas vezes o modelo foi chamado na execução.
Consultas de dadosQuantas consultas ao Vendelo a Filipa fez.
Duração (s)Tempo da execução, em segundos.
Encerrado porComo a execução terminou: Concluído, Relatório exibido, Aguardando resposta, Limite de tokens, Limite de consultas internas, Limite de tempo ou Limite de iterações.
FinalidadeConversa, Arquivo ou Agente.

Cada linha corresponde a um turno de conversa (uma pergunta e a resposta completa da Filipa, incluindo as consultas intermediárias ao Vendelo), a uma geração de arquivo ou a uma execução de agente. Quando a Filipa faz uma pergunta interativa no meio do turno, a linha fica com “Aguardando resposta” e a continuação, depois da sua resposta, gera outra linha. No celular, os cartões reúnem “Tokens (entrada/saída)”, “Cache (lidos/gravados)” e “Diagnóstico (inferências, consultas, duração e encerramento)”.

Como interpretar os números

  • Entrada muito maior que saída: é o padrão. A entrada carrega instruções, histórico e dados; a saída é só a resposta.
  • Entrada crescendo ao longo de uma conversa: conversas longas acumulam histórico. Sugira aos usuários iniciar uma nova conversa ao mudar de assunto.
  • Saída alta: relatórios visuais e respostas extensas. Normal em análises de fila de aprovação e comparativos.
  • Muitas linhas do mesmo usuário em poucos minutos: uso intenso ou tentativas repetidas. Vale conversar com o usuário sobre como pedir melhor.
  • Pouco cache lido em conversas longas: o provedor não está reaproveitando o contexto; o custo por turno tende a ser maior.
  • Encerrado por um limite: a execução parou por um teto de Limites de uso da IA. Se isso se repete em pedidos legítimos, revise o limite correspondente com o usuário master.

Nesta versão, os filtros de Finalidade e Provedor comparam com o código interno gravado, não com o texto exibido na coluna. Para filtrar por finalidade, use a condição Igual com UI_INTERACTION (Conversa), CONTENT_GENERATION (Arquivo) ou AGENTS (Agente); para provedor, OPENAI, ANTHROPIC, VDO_HOSTED_CODEX ou VDO_HOSTED_CLAUDE.

Tela: uso tokens filtrado por finalidade (computador)
Lista filtrada pela finalidade Arquivo (código CONTENT_GENERATION), com o consumo de cada geração

Filtros, ordenação e exportação

Use os recursos padrão das listas do Vendelo: filtro e ordenação por data, provedor, modelo, finalidade, encerramento e totais; pesquisas favoritas para os recortes que você consulta com frequência (por exemplo, “mês atual, finalidade Agente”); e exportação para o Excel para somar por usuário, por modelo ou por dia e cruzar com a tabela de preços do provedor.

Exporte o mês inteiro para o Excel e monte uma tabela dinâmica por usuário e modelo. Multiplique pelos preços do provedor para estimar o custo por pessoa.

Limites e créditos

Não existe orçamento mensal em reais no Vendelo. O que limita o consumo são os tetos da aba Limites de uso da IA (tokens por turno e por geração, simultaneidade e filas), definidos pelo usuário master. A conta do provedor pode ter os próprios limites de crédito; quando eles acabam, a Filipa informa que a conta está sem créditos e um administrador precisa regularizar. Esta tela é a referência para acompanhar o consumo e ajustar esses tetos.

Perguntas frequentes

A tela mostra o custo em reais?

Não. Mostra tokens. O custo depende da tabela do provedor e do modelo; calcule a partir da exportação.

Os tokens dos agentes autônomos aparecem aqui?

Sim, com a finalidade Agente. A tela Filipa IA, Agentes, Uso de tokens dos agentes mostra o mesmo consumo organizado por execução de agente; não some as duas telas.

Uma pergunta pode gerar mais de uma linha?

Em geral, cada turno gera uma linha com o total do turno, mesmo que a Filipa tenha feito várias consultas internas. A exceção é a pergunta interativa: a linha fecha com “Aguardando resposta” e a continuação gera outra.

Vejo o texto das perguntas?

Não. A tela mostra dados de consumo e diagnóstico, nunca o conteúdo. As conversas são privadas de cada usuário.

Posso limitar o consumo por usuário?

Não há orçamento por usuário. Existem, por usuário, os limites de conversas e gerações simultâneas e pendentes, em Limites de uso da IA, além dos tetos de tokens por turno. Para impedir um usuário de usar a Filipa, ajuste as permissões do perfil.

Próxima leitura

Agentes autônomos da Filipa: visão geral: transforme pedidos recorrentes em agentes que rodam sozinhos e entregam o resultado.