Enquanto esperávamos pelo Google, antropia e Deepseek para desafiar o Openai, o Xai de Elon Musk emergiu rapidamente como seu concorrente mais próximo nesta semana. Em um período tão curto, a Xai desenvolveu o modelo GROK 3, apresentando resultados impressionantes de referência. Então, fizemos um mergulho profundo e testamos o Grok 3 modelos de base e raciocínio Em uma variedade de avisos complexos, e o que descobrimos foi realmente surpreendente.
Consultas de raciocínio no Grok 3
Comecei a testar o modelo de raciocínio Grok 3 com a pergunta popular de morango, e ele respondeu corretamente que existem três r’s na palavra morango Depois de pensar por 15 segundos. Joguei outra palavra “Lollapalooza” e pedi para contar o número de L’s e ela respondeu com 4, o que está correto.
Em seguida, perguntei a Grok 3 qual número é maior – 9.11 ou 9.9. Novamente, Grok 3 pensou por 8 segundos e teve a resposta certa. De fato, o modelo GROK 3 desenvolveu vários métodos matemáticos para verificar o resultado final, o que foi impressionante.
Depois disso, eu postei esse quebra -cabeça ligeiramente ajustado para Grok 3 para equivocá -lo. Na minha comparação anterior entre Chatgpt O1 e Deepseek R1, ambos os modelos entenderam a resposta e disseram que o cirurgião era a mãe do garoto. Mesmo o mais recente OpenAi O3-Mini-High erra a resposta, ignorando completamente o fato de que está claramente declarado no aviso de que o cirurgião é o pai do garoto.
The surgeon, who is the boy's father, says "I cannot operate on this boy, he's my son!" Who is the surgeon to the boy?
Finalmente, o modelo de raciocínio Grok 3 pensou por 35 segundos e disse que o cirurgião é o pai do garoto, que está correto. O que eu amei no Grok 3 é que ele argumentou: “É possível que este seja um enigma mal formado sem uma reviravolta inteligente, ou talvez seja testando se pensamos demais. Mas baseado apenas no texto, o relacionamento é explícito.“Ele também pensou em voz alta,”A menção de não operar pode ser contexto ou um arenque vermelho.““
Gemini 2.0 Flash Thinking vs Chatgpt O1: Openai acha mais fundo
Grok 3 é o único modelo de raciocínio a acertar a resposta, além do flash Gemini 2.0. Não foi equivocado e não tentou sem parar para encontrar a reviravolta e estabelecer um novo relacionamento de alguma forma.

In Greek mythology, who was Jason's maternal great-grandfather?
Por fim, fiz uma pergunta do último exame da humanidade (Hle), e o modelo de raciocínio Grok 3 o acrescentou em apenas 47 segundos. Anteriormente, apenas O3-Mini-High conseguiu acertar a resposta em 1 minuto e 25 segundos. Até o Deepseek R1 não conseguiu encontrar a resposta corretamente. Eu diria que, atualmente, o Grok 3 tem o melhor modelo de raciocínio, e ele ultrapassa o Openi-Mini-High-High, O1 e Deepseek R1 do Openai.
Desempenho de codificação de Grok 3
Para testar a capacidade de codificação da GROK 3, pedi ao modelo de raciocínio que escrevesse um programa Python que mostra uma bola saltando dentro de um hexágono. Basicamente, a bola deve seguir os princípios da física e ricocular naturalmente.
Grok 3 pensou por mais de um minuto e gerou o código Python. Eu corri o código no meu PC e a bola não conseguiu pular. Simplesmente pulou do lado de fora do hexágono. Foi bastante surpreendente, pois o modelo de raciocínio da GROK 3 alcançou uma ótima pontuação no benchmark LivecodeBench.
Write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically

Por isso, perguntei ao modelo GROK 3 de base que não é o mesmo código para gerar o mesmo código Python. Surpreendentemente, funcionou na primeira tentativa e a bola ricocheteou com grande precisão. A bola seguiu um caminho natural e simulou o movimento da bola perfeitamente. Talvez, o modelo de raciocínio sobreangueu o problema, levando a uma falha na função de detecção de colisão.
O que é cursor ai, o substituto do chatgpt para codificação
Eu diria que o modelo base GROK 3 não é raciocínio é sólido para tarefas de codificação. No entanto, este é um dos muitos testes, e você deve usar modelos de raciocínio e não raciocínio na sua base de código para verificar qual é o desempenho melhor.
Agente de AI Deepsearch da GROK 3
Xai também lançou um novo agente de IA chamado “DeepSearch”Construído no modelo GROK 3. É semelhante ao profundo agente de pesquisa do OpenAI, que é construído no modelo completo de O3, que navega na Web, faz pesquisas e gera um relatório abrangente em 5 a 30 minutos. O DeepSearch do Grok 3, no entanto, leva apenas alguns minutos.

Então eu pedi ao agente da IA do Grok 3 DeepSearch para pesquisar “Como a IA está transformando o processo de design de chips?” Ele iniciou o processo de pensamento e acessou várias páginas da Web, incluindo artigos científicos da IEEE, ACM e muito mais. Em mais de um minuto, o agente da AI do DeepSearch gerou um relatório de 1300 palavras, incluindo citações, tabelas e pontos-chave em linha.

Enquanto o relatório explicou os circuitos RL da NVIDIA e o conjunto de dados de piso da Intel para um processo de design de chips movido a IA, ele não mencionou completamente o Google’s Alphachip Estrutura para gerar plantas de chip. O relatório final é semelhante à nova ferramenta de pesquisa profunda da Perplexity. Ambas as ferramentas são rápidas, mas com um brilho sobre muitos avanços recentes.
Viés político de Grok 3
O proprietário de Xai, Elon Musk, criticou sempre o Chatgpt por ter sido acordado e ter um viés de esquerda. Em abril de 2024, almíscar anunciou planos para criar “verdade” e desenvolver uma “IA máxima em busca da verdade”.
Pouco antes do lançamento do Grok 3, Musk compartilhado Uma resposta do modelo GROK 3 chamando um “lixo” de mídia. Muitos pensaram que o modelo GROK 3 seria politicamente conservador e se inclinaria à direita.

No entanto, em meus testes, Grok 3 é o mais politicamente neutro possível. Mesmo depois de empurrar o Grok 3 para assumir uma posição sobre o assunto, ele explica a diferença e deixa a preferência e a discrição do usuário. Além do domínio da política, mesmo em questões sociais, como direitos de transgêneros, programas DEI, imigração e ação afirmativa – tópicos que Musk criticou abertamente – Grok 3 mantém sua posição neutra.

O interessante é que Grok 3 não se esquiva de brincar sobre seu proprietário, Elon Musk, e o atual presidente dos EUA, Donald Trump.
Guarda de segurança da Grok 3
Quando testei o GROK 2 no ano passado, era amplamente sem censura e não tinha nenhum corrimão de segurança. Grok 2 gerou chocantemente um email para enganar as pessoas. No entanto, o GROK 3 tem um corrimão de segurança muito melhor, o que é uma boa notícia para a segurança da IA. Se você solicitar a Grok 3 com algo prejudicial, ele menciona: “Não posso ajudar com nada destinado a prejudicar ou enganar os outros”.

Quanto à geração de imagens de IA, o atual gerador de imagens GROK no GROK.com não gera imagens. No entanto, em X, ele ainda gera imagens de figuras e celebridades públicas sem nenhum corrimão de segurança, o que é preocupante. É alimentado pela casa de Xai aurora Modelo de geração de imagens.
Grok 3: Veredicto precoce
A Xai lançou modelos de base Grok 3 maiores e raciocínio e, na minha avaliação, os dois são modelos de IA frontier que se aproximam do modelo completo do OpenAi O3. Até agora, o OpenAI só lançou O3-mini e O3-Mini-High, além do modelo completo de O3, que alimenta a profunda pesquisa da IA Agent.
Com base nos meus testes antecipados, posso dizer que o modelo de raciocínio Grok 3 ultrapassa (ou pelo menos corresponde) todos os modelos disponíveis, incluindo o OpenAi O3-Mini e Deepseek R1. Obviamente, esse veredicto é baseado no esforço padrão de “pensamento”. O XAI possui uma configuração de “cérebro grande” para o modelo de raciocínio Grok 3, que usa mais computação para pensar por mais tempo. Ele estará disponível para assinantes do Supergrok.
Seu modelo base GROK 3 não é mais capaz que o GPT-4O, o Claude 3,5 sonetos e o Gemini 2.0 Pro, tornando-se uma alternativa sólida ao ChatGPT. Talvez para as tarefas de codificação, Claude 3,5 sonetos ainda possa vencer, mas a lacuna está diminuindo significativamente.
A Xai, liderada por almíscar, fez um tremendo trabalho no desenvolvimento de um poderoso modelo GROK 3 pré-treinado e um modelo de raciocínio com escala de inferência. Agora, precisamos esperar os modelos GPT-4.5 e GPT-5 do OpenAI, que devem ser lançados nas próximas semanas e meses.
Mas, neste momento, Xai se levantou para desafiar o domínio de Openai no espaço da IA. Além da batalha legal, a luta entre Elon Musk e Sam Altman se enfurece.
Apoie o nosso trabalho ❤️
Se você gostou deste artigo, considere deixar uma gorjeta para nos ajudar a continuar publicando conteúdo de qualidade.



















