Guia de Instalação e Execução de LLMs Localmente em Telefones Android.

Guia de Instalação e Execução de LLMs Localmente em Telefones Android.

Embora existam aplicativos como LM Studio e GPT4All para executar modelos de IA localmente em computadores, não temos muitas dessas opções em telefones Android. Dito isso, o MLC LLM desenvolveu um aplicativo Android chamado MLC Chat que permite baixar e executar modelos LLM localmente em dispositivos Android. Você pode baixar pequenos modelos de IA (2B a 8B) como Llama 3, Gemma, Phi-2, Mistral e muito mais. Com essa nota, vamos começar.

Observação:
Atualmente, o MLC Chat não usa o NPU do dispositivo em todos os dispositivos Snapdragon, portanto a geração de tokens é bastante lenta. A inferência é feita apenas na CPU. Alguns dispositivos como o Samsung Galaxy S23 Ultra (com Snapdragon 8 Gen 2) são otimizados para executar o aplicativo MLC Chat para que você tenha uma experiência melhor.

  • Vá em frente e baixe o Aplicativo de bate-papo MLC (Livre) para telefones Android. Você terá que baixar o arquivo APK (148 MB) e instalá-lo.
  • Em seguida, inicie o aplicativo MLC Chat e você verá um lista de modelos de IA. Ele suporta até mesmo o modelo Llama 3 8B mais recente e você também tem opções como Phi-2, Gemma 2B e Mistral 7B.
  • Eu baixei o da Microsoft Modelo Phi-2 pois é pequeno e leve.
  • Depois que o modelo for baixado, toque no botão de bate-papo ao lado do modelo.
  • Agora você pode comece a conversar com o modelo AI localmente em seu telefone Android. Você nem precisa de uma conexão com a internet.
  • Em meus testes, Phi-2 funcionou bem no meu telefone, mas houve alguma alucinação. Gemma se recusou a fugir. E o Llama 3 8B era muito lento.
executando modelos de IA localmente no telefone Android

  • No meu OnePlus 7T, que é equipado com o Snapdragon 855+ SoC, um chip de cinco anos, ele gerou saída em 3 fichas por segundo enquanto executa o Phi-2.

Então é assim que você pode baixar e executar modelos LLM localmente em seu dispositivo Android. Claro, a geração de tokens é lenta, mas mostra que agora você pode executar modelos de IA localmente em seu telefone Android. Atualmente, é usando apenas a CPUmas com a implementação do Qualcomm AI Stack, os dispositivos Android baseados em Snapdragon podem aproveitar o NPU, GPU e CPU dedicados para oferecer um desempenho muito melhor.

Do lado da Apple, os desenvolvedores já estão usando o Estrutura MLX para inferência local rápida em iPhones. Está gerando perto de 8 fichas por segundo. Portanto, espere que os dispositivos Android também obtenham suporte para o NPU no dispositivo e ofereçam ótimo desempenho. Aliás, a própria Qualcomm diz que o Snapdragon 8 Gen 2 pode gerar 8,48 fichas por segundo durante a execução de um modelo 7B maior. Teria um desempenho ainda melhor em um modelo quantizado 2B.

De qualquer forma, isso é tudo nosso. Se você quiser conversar com seus documentos usando um modelo de IA local, confira nosso artigo dedicado. E se você estiver enfrentando algum problema, informe-nos na seção de comentários abaixo.

Apoie o nosso trabalho ❤️

Se você gostou deste artigo, considere deixar uma gorjeta para nos ajudar a continuar publicando conteúdo de qualidade.

Pagamento seguro no PayPal
Veja também:  Odisseia Woke Conquista Bilheteria Global Enquanto Direita Reage
Moyens I/O Staff motivou você, dando conselhos sobre tecnologia, desenvolvimento pessoal, estilo de vida e estratégias que irão ajudá-lo.