Embora existam aplicativos como LM Studio e GPT4All para executar modelos de IA localmente em computadores, não temos muitas dessas opções em telefones Android. Dito isso, o MLC LLM desenvolveu um aplicativo Android chamado MLC Chat que permite baixar e executar modelos LLM localmente em dispositivos Android. Você pode baixar pequenos modelos de IA (2B a 8B) como Llama 3, Gemma, Phi-2, Mistral e muito mais. Com essa nota, vamos começar.
Observação:
Atualmente, o MLC Chat não usa o NPU do dispositivo em todos os dispositivos Snapdragon, portanto a geração de tokens é bastante lenta. A inferência é feita apenas na CPU. Alguns dispositivos como o Samsung Galaxy S23 Ultra (com Snapdragon 8 Gen 2) são otimizados para executar o aplicativo MLC Chat para que você tenha uma experiência melhor.
- Vá em frente e baixe o Aplicativo de bate-papo MLC (Livre) para telefones Android. Você terá que baixar o arquivo APK (148 MB) e instalá-lo.
- Em seguida, inicie o aplicativo MLC Chat e você verá um lista de modelos de IA. Ele suporta até mesmo o modelo Llama 3 8B mais recente e você também tem opções como Phi-2, Gemma 2B e Mistral 7B.
- Eu baixei o da Microsoft Modelo Phi-2 pois é pequeno e leve.
- Depois que o modelo for baixado, toque no botão de bate-papo ao lado do modelo.
- Agora você pode comece a conversar com o modelo AI localmente em seu telefone Android. Você nem precisa de uma conexão com a internet.
- Em meus testes, Phi-2 funcionou bem no meu telefone, mas houve alguma alucinação. Gemma se recusou a fugir. E o Llama 3 8B era muito lento.

- No meu OnePlus 7T, que é equipado com o Snapdragon 855+ SoC, um chip de cinco anos, ele gerou saída em 3 fichas por segundo enquanto executa o Phi-2.
Então é assim que você pode baixar e executar modelos LLM localmente em seu dispositivo Android. Claro, a geração de tokens é lenta, mas mostra que agora você pode executar modelos de IA localmente em seu telefone Android. Atualmente, é usando apenas a CPUmas com a implementação do Qualcomm AI Stack, os dispositivos Android baseados em Snapdragon podem aproveitar o NPU, GPU e CPU dedicados para oferecer um desempenho muito melhor.
Do lado da Apple, os desenvolvedores já estão usando o Estrutura MLX para inferência local rápida em iPhones. Está gerando perto de 8 fichas por segundo. Portanto, espere que os dispositivos Android também obtenham suporte para o NPU no dispositivo e ofereçam ótimo desempenho. Aliás, a própria Qualcomm diz que o Snapdragon 8 Gen 2 pode gerar 8,48 fichas por segundo durante a execução de um modelo 7B maior. Teria um desempenho ainda melhor em um modelo quantizado 2B.
De qualquer forma, isso é tudo nosso. Se você quiser conversar com seus documentos usando um modelo de IA local, confira nosso artigo dedicado. E se você estiver enfrentando algum problema, informe-nos na seção de comentários abaixo.
Apoie o nosso trabalho ❤️
Se você gostou deste artigo, considere deixar uma gorjeta para nos ajudar a continuar publicando conteúdo de qualidade.




















