Mensagem do Gate News, 23 de Abril — Investigadores da Google, incluindo He Kaiming e Xie Saining, publicaram um artigo que apresenta o Vision Banana, um modelo de compreensão visual de propósito geral criado através do ajuste fino leve de instruções do modelo de geração de imagens Nano Banana Pro ( Gemini 3 Pro Image) da empresa. A principal inovação unifica as saídas de todas as tarefas visuais como imagens RGB, permitindo segmentação, estimativa de profundidade e previsão de normais de superfície através de geração de imagens, sem arquiteturas ou funções de perda específicas da tarefa.
Na segmentação semântica, o Vision Banana superou o modelo especializado SAM 3 em 4,7 pontos percentuais no Cityscapes; na segmentação de expressões de referência, ultrapassou o SAM 3 Agent. No entanto, ficou aquém do SAM 3 na segmentação de instâncias. Para tarefas 3D, a estimativa métrica de profundidade atingiu 0,929 de precisão média em quatro conjuntos de dados padrão, excedendo os 0,918 do Depth Anything V3, usando apenas dados sintéticos sem informação real de profundidade ou parâmetros de câmara na inferência. A estimativa de normais de superfície alcançou resultados de última geração em três benchmarks interiores.
O ajuste fino envolveu dados mínimos de tarefas visuais misturados no treino original de geração de imagens, preservando as capacidades de geração do modelo — o desempenho correspondeu ao Nano Banana Pro original nos testes de qualidade de geração. O artigo propõe que o pré-treino de geração de imagens em visão é semelhante ao pré-treino de geração de texto em linguagem: os modelos aprendem as representações internas necessárias para a compreensão de imagens durante a geração, enquanto o ajuste fino por instruções apenas liberta esta capacidade.
Related News
O Chrome torna-se um “colega de IA”: tarefas de automação de navegação automática (Auto Browse) e mensalidade de 6 dólares para empresas
Google Cloud Next 2026: lança a plataforma de agentes empresariais Gemini, 750 milhões de dólares para ajudar os consultores a implementarem
A Google alarga a Wiz Cloud Security a nível do AWS, Azure e Google Cloud