O Google vem aprimorando silenciosamente o Bard e adicionando novos recursos a cada poucas semanas, elevando suas capacidades ao nível do ChatGPT. Agora, a empresa adicionou a capacidade de enviar imagens para o Bard para uma experiência muito mais ampla além do texto. Não se engane, o Google Bard ainda é um modelo de linguagem grande somente de texto. No entanto, o gigante das buscas integrou o Google Lens, a busca reversa de imagens e alguns sistemas VQA (Visual Question Answering) para fazer o Bard parecer um modelo multimodal. No entanto, a capacidade de visão atual do Bard é de fato um tanto surpreendente, e nós a testamos abaixo para aprender sobre suas capacidades. Com isso em mente, vamos dar uma olhada em alguns exemplos interessantes de uploads de imagens no Google Bard.
1. Extrair textos de imagens
A melhor utilidade da capacidade de manipulação de imagens do Bard é que agora você pode carregar uma imagem clicando no (+) botão. Ele pode então rapidamente pegar textos dos uploads. O Google Bard então executa OCR automaticamente e faz um trabalho preciso. Dito isso, apesar de uma longa lista de suporte de idiomas no Bard, atualmente, a funcionalidade OCR só funciona para o idioma inglês. Tentei vários idiomas internacionais e regionais, mas ele não conseguiu capturar textos de imagens digitalizadas. No entanto, para extração rápida de texto de imagens, o Bard pode ser muito útil.
2. Extrair tabelas com formatação intacta
Todos nós lutamos quando temos que extrair tabelas de imagens ou documentos digitalizados. No entanto, o Google Bard pode extrair tabelas sem esforço com a formatação intacta. Na verdade, você pode exportar a tabela para o Planilhas Google também e fazer mais edições ou processamento de dados. Quão legal é isso? Dito isso, atualmente, o Bard alucina muito e, em alguns casos, preenche as células com dados errados, então certifique-se de verificá-los antes de exportá-los.
3. Gerar código para sites/aplicativos usando mockups
Para mostrar o recurso de multimodalidade do GPT-4, em março de 2023, a OpenAI demonstrou como seu modelo entendeu a nota rabiscada e rapidamente criou um mockup do site a partir de um pedaço de papel. Embora o recurso multimodal ainda esteja para chegar ao GPT-4, o Google Bard é capaz de gerar código que corresponde ao mockup. Tenha em mente que Bard não é um modelo multimodal mas usa segmentação de imagem via Google Lens para entender a imagem. No entanto, Bard nos surpreendeu com seus resultados.
Enviei uma captura de tela da página de destino do Facebook e ela gerou rapidamente código em HTML e CSS que parecia um pouco similar. Também carreguei uma imagem de um site simples que desenhei no papel, e o Google Bard fez um bom trabalho ao recriá-lo. Além disso, você pode usar métodos semelhantes para recriar UIs para aplicativos de smartphone e outros sites também.
4. O Google Bard pode explicar imagens
O Google Bard é bom em explicar imagens e resumir o que está acontecendo nelas. Você pode fazer upload de imagens obscuras, e isso pode produzir informações confiáveis rapidamente. Eu carreguei uma imagem de baixa qualidade de um mecanismo biológico, e ela identificou corretamente como Mitose Celular. Ela explicou ainda mais o processo passo a passo.
Em outro exemplo, eu carregou um gráfico, e ele entendeu corretamente a imagem e explicou os dados. Ele até criou uma tabela dos pontos de dados para que eu pudesse trabalhar nela no Planilhas Google. Particularmente para estudantes, Bard pode ser útil para entender conceitos em ciências e outros tópicos. Você pode simplesmente carregar uma imagem e perguntar a Bard sobre ela.
5. Obtenha informações nutricionais de imagens

Usando a capacidade de manipulação de imagens do Bard, você pode obter o valores nutricionais dos alimentos. Basta carregar a imagem da comida no seu prato e ela será calcular a caloria total em segundos. Isso pode ser imensamente útil para pessoas que estão em uma dieta regulada.
No meu teste, ele não conseguiu avaliar o tamanho da porção, mas deu exemplos para que você pudesse calcular a ingestão total de calorias sozinho. Parece que o Google está usando segmentação de imagens para categorizar itens alimentares e obter informações nutricionais.
6. Improvise receitas de comida
Outro excelente caso de uso é adicionar a imagem de itens de alimentos crus e pedir ao Google Bard para criar várias receitas de alimentos. Você também pode adicionar imagens de itens de alimentos em sua geladeira, e ele criará sem esforço receitas personalizadas para você. Além disso, você pode pedir ao Bard por culinárias específicas de várias partes do mundo. E se você estiver de dieta, pode pedir ao Google Bard para criar receitas de comida sem gordura e de baixa caloria para saciedade.
7. Resolva questões matemáticas
Você pode usar o Google Bard para resolver questões matemáticas também. Você pode enviar uma imagem dos seus problemas de matemática para o Bard, e ele irá tente resolver a questão para você. Em meus testes, a abordagem do Bard estava correta, mas devido a problemas de notação, ele só apresentou respostas erradas. Acho que será necessária uma atualização em seu sistema de visão para tornar o Bard mais adequado para lidar com notações e questões matemáticas.
8. Explique memes e piadas
O Google Bard também pode explicar memes e piadas. Você pode enviar imagens de memes e desenhos animados engraçados e pergunte ao Bard o que é engraçado quase o mesmo, e ele fornecerá sua própria interpretação. Eu carreguei a mesma imagem que a OpenAI demonstrou durante a revelação do GPT-4, e Bard entendeu corretamente o absurdo hilário por trás da imagem.
Em outra ocasião, carreguei uma imagem do The New Yorker Cartoons no Google Bard e pedi para explique a piada. No entanto, dessa vez, ele simplesmente explicou a cena e não conseguiu dizer por que a imagem era engraçada. Ele perdeu completamente a frase de e-mail que é comumente usada em locais de trabalho. Eu sugiro que você experimente o Google Bard e verifique se ele é inteligente o suficiente para entender sagacidade e humor.
9. Traduzir equações para LaTeX
Simples #Bardo dica, basta pegar a imagem de uma equação e renderizá-la em Latex. foto.twitter.com/XXvuEW1LQB— Carlos E. Perez (@IntuitMachine) 15 de julho de 2023
Não é segredo que muitas pessoas acham difícil escrever em LaTeX e preferem usar processadores de texto. No entanto, para artigos de pesquisa científica e escrita acadêmica, o LaTeX é necessário para adicionando equações complexas e composição de alta qualidade. Em tal cenário, o Google Bard pode ser útil. Você pode adicionar imagens de equações, e o Bard pode traduzi-las para código LaTeX. Isso é incrível, certo? Então, vá em frente e traduza as equações para código LaTeX em pouco tempo.
10. Carregue relatórios médicos e faça perguntas
Por fim, você pode carregar imagens de seus relatórios médicos e digitalizá-los para o Google Bard. Você pode então fazer perguntas médicas com base neles. Alguns médicos no Twitter mostraram que o Bard é bastante decente para diagnóstico diferencial. Também pode ajudar os usuários a entender sua saúde e a dar sentido aos relatórios médicos
Googleのbard凄い & 怖い !!!
Bardによる脳CTの診断!
「画像には脳の白い部分が写っていると言えます。。。脳腫瘍、脳卒中、出血など、さまざまな原因が考えられます」
答えは脳出血です。その鑑別診断を挙げるだけでも凄いですね。特化型で学習しているわけではありませんので。 foto.twitter.com/aEdF5xtlqt— 河野 健一 生成AI ✕ 医療に注目! 手術支援AI CEO 脳外科医 (@CeoImed) 14 de julho de 2023
Dito isto, tenha em mente que o Google Bard está sendo executado em um LLM de uso geral chamado PaLM 2. O gigante das buscas desenvolveu um modelo separado de domínio médico Med-PaLM 2, que é bastante preciso e avançado, mas ainda não está disponível para usuários em geral. Então, recomendo que os usuários fiquem longe de qualquer tipo de autodiagnóstico usando o Bard. É altamente recomendável consultar um médico. E, finalmente, se você enviar seus relatórios médicos pessoais para o Bard, certifique-se de excluir os chats do Bard para proteger sua privacidade.
Apoie o nosso trabalho ❤️
Se você gostou deste artigo, considere deixar uma gorjeta para nos ajudar a continuar publicando conteúdo de qualidade.




































