Toda interação com a Filipa consome tokens do provedor de IA, e o Vendelo registra esse consumo. A tela Uso de tokens do assistente lista cada execução de IA da empresa (conversas, geração de arquivos e agentes) com usuário, provedor, modelo, tokens de entrada, de saída e de cache, e um diagnóstico de como a execução terminou, para que gestores e administradores acompanhem o uso, identifiquem padrões e dimensionem o orçamento. Este artigo explica o que é um token, o que cada coluna significa, como filtrar e exportar, e como interpretar os números.
Índice
O que são tokens
Token é a unidade que os provedores de IA usam para medir texto: aproximadamente três quartos de uma palavra em português. Cada pedido à Filipa envia tokens ao modelo (entrada: a sua pergunta, o histórico da conversa, as instruções e os dados consultados no Vendelo) e recebe tokens de volta (saída: a resposta, os relatórios visuais e as chamadas de consulta). Os provedores cobram por tokens, com preços diferentes para entrada e saída e para cada modelo.
Uma pergunta simples pode consumir poucos milhares de tokens de entrada, porque as instruções e o esquema de dados do Vendelo acompanham cada pedido. Isso é normal e esperado.
Onde fica e quem vê
Abra Filipa IA, Assistente, Uso de tokens do assistente. A tela exige a permissão Interações com a assistente de IA no perfil (ou usuário master) e a função “Conversas interativas com a Filipa” ligada. Ela mostra o consumo de todos os usuários da empresa.
Colunas da lista
| Coluna | Conteúdo |
|---|---|
| Data de criação | Data e hora da execução. |
| Usuário | Quem fez o pedido (nos agentes, o proprietário do agente). É calculado na hora da consulta, por isso não aceita filtro nem ordenação. |
| Provedor | Provedor de IA usado na execução. |
| Modelo | Modelo de IA que respondeu. |
| Tokens entrada / Tokens saída | Tokens enviados ao modelo e gerados por ele. |
| Tokens lidos do cache / Tokens gravados no cache | Parte da entrada que o provedor reaproveitou do cache (mais barata) e a que foi gravada no cache para as próximas chamadas. |
| Inferências | Quantas vezes o modelo foi chamado na execução. |
| Consultas de dados | Quantas consultas ao Vendelo a Filipa fez. |
| Duração (s) | Tempo da execução, em segundos. |
| Encerrado por | Como a execução terminou: Concluído, Relatório exibido, Aguardando resposta, Limite de tokens, Limite de consultas internas, Limite de tempo ou Limite de iterações. |
| Finalidade | Conversa, Arquivo ou Agente. |
Cada linha corresponde a um turno de conversa (uma pergunta e a resposta completa da Filipa, incluindo as consultas intermediárias ao Vendelo), a uma geração de arquivo ou a uma execução de agente. Quando a Filipa faz uma pergunta interativa no meio do turno, a linha fica com “Aguardando resposta” e a continuação, depois da sua resposta, gera outra linha. No celular, os cartões reúnem “Tokens (entrada/saída)”, “Cache (lidos/gravados)” e “Diagnóstico (inferências, consultas, duração e encerramento)”.
Como interpretar os números
- Entrada muito maior que saída: é o padrão. A entrada carrega instruções, histórico e dados; a saída é só a resposta.
- Entrada crescendo ao longo de uma conversa: conversas longas acumulam histórico. Sugira aos usuários iniciar uma nova conversa ao mudar de assunto.
- Saída alta: relatórios visuais e respostas extensas. Normal em análises de fila de aprovação e comparativos.
- Muitas linhas do mesmo usuário em poucos minutos: uso intenso ou tentativas repetidas. Vale conversar com o usuário sobre como pedir melhor.
- Pouco cache lido em conversas longas: o provedor não está reaproveitando o contexto; o custo por turno tende a ser maior.
- Encerrado por um limite: a execução parou por um teto de Limites de uso da IA. Se isso se repete em pedidos legítimos, revise o limite correspondente com o usuário master.
Nesta versão, os filtros de Finalidade e Provedor comparam com o código interno gravado, não com o texto exibido na coluna. Para filtrar por finalidade, use a condição Igual com UI_INTERACTION (Conversa), CONTENT_GENERATION (Arquivo) ou AGENTS (Agente); para provedor, OPENAI, ANTHROPIC, VDO_HOSTED_CODEX ou VDO_HOSTED_CLAUDE.
Filtros, ordenação e exportação
Use os recursos padrão das listas do Vendelo: filtro e ordenação por data, provedor, modelo, finalidade, encerramento e totais; pesquisas favoritas para os recortes que você consulta com frequência (por exemplo, “mês atual, finalidade Agente”); e exportação para o Excel para somar por usuário, por modelo ou por dia e cruzar com a tabela de preços do provedor.
Exporte o mês inteiro para o Excel e monte uma tabela dinâmica por usuário e modelo. Multiplique pelos preços do provedor para estimar o custo por pessoa.
Limites e créditos
Não existe orçamento mensal em reais no Vendelo. O que limita o consumo são os tetos da aba Limites de uso da IA (tokens por turno e por geração, simultaneidade e filas), definidos pelo usuário master. A conta do provedor pode ter os próprios limites de crédito; quando eles acabam, a Filipa informa que a conta está sem créditos e um administrador precisa regularizar. Esta tela é a referência para acompanhar o consumo e ajustar esses tetos.
Perguntas frequentes
A tela mostra o custo em reais?
Não. Mostra tokens. O custo depende da tabela do provedor e do modelo; calcule a partir da exportação.
Os tokens dos agentes autônomos aparecem aqui?
Sim, com a finalidade Agente. A tela Filipa IA, Agentes, Uso de tokens dos agentes mostra o mesmo consumo organizado por execução de agente; não some as duas telas.
Uma pergunta pode gerar mais de uma linha?
Em geral, cada turno gera uma linha com o total do turno, mesmo que a Filipa tenha feito várias consultas internas. A exceção é a pergunta interativa: a linha fecha com “Aguardando resposta” e a continuação gera outra.
Vejo o texto das perguntas?
Não. A tela mostra dados de consumo e diagnóstico, nunca o conteúdo. As conversas são privadas de cada usuário.
Posso limitar o consumo por usuário?
Não há orçamento por usuário. Existem, por usuário, os limites de conversas e gerações simultâneas e pendentes, em Limites de uso da IA, além dos tetos de tokens por turno. Para impedir um usuário de usar a Filipa, ajuste as permissões do perfil.
Próxima leitura
Agentes autônomos da Filipa: visão geral: transforme pedidos recorrentes em agentes que rodam sozinhos e entregam o resultado.