Desenvolvidos para dar resposta aos desafios das interações por voz com chatbots, os três novos modelos da OpenAI já estão disponíveis para programadores na Realtime API.

A OpenAI lançou três novos modelos de áudio desenvolvidos para experiências de voz mais naturais, com respostas mais inteligentes e capacidade de agir em tempo real.

Para a tecnológica liderada por Sam Altman, a voz está a tornar-se numa das formas mais naturais de interagir com software. No entanto, desenvolver aplicações que se baseiam neste tipo de interações exige mais do que respostas rápidas ou uma voz natural. 

Não perca nenhuma notícia importante da atualidade de tecnologia e acompanhe tudo em tek.sapo.pt

Segundo a empresa, os agentes de voz precisam de compreender a intenção dos utilizadores, manter o contexto da conversa, adaptar-se quando os pedidos mudam, utilizar ferramentas enquanto as interações decorrem e responder de forma adequada ao momento. 

Os novos modelos foram desenvolvidos para dar resposta a estes desafios, indo além das interações num modelo de pergunta-resposta, afirma a tecnológica

O GPT-Realtime-2 afirma-se como o primeiro modelo de voz da OpenAI com capacidade de raciocínio ao nível do GPT-5, sendo capaz de lidar com pedidos mais complexos e de manter a conversa a fluir de maneira natural. 

O modelo é capaz de realizar várias tarefas em simultâneo e de narrar o que está a fazer, usando também expressões que ajudam os utilizadores a perceber que o sistema está a processar o pedido. 


GPT-5.5 da OpenAI é “mais inteligente e intuitivo”, e cada vez mais próximo da visão de uma “super aplicação”


Inteligência Artificial
GPT-5.5 da OpenAI é “mais inteligente e intuitivo”, e cada vez mais próximo da visão de uma “super aplicação”

O novo modelo da OpenAI promete executar tarefas complexas com menos instruções, com ganhos expressivos em áreas como a programação, investigação científica e uso autónomo de ferramentas informáticas.

Com uma janela de contexto maior (128 mil tokens), o GPT-Realtime-2 permite também sessões mais longas e fluxos de tarefas mais complexos, aponta a OpenAI. 

Já o GPT-Realtime-Translate é um modelo de tradução capaz de converter em tempo real o que está a ser dito em mais 70 línguas para 13 idiomas diferentes, acompanhando o ritmo de quem está a falar, afirma a OpenAI. 

A estes dois modelos junta-se o GPT-Realtime-Whisper, focado na transcrição contínua e nas capacidades de converter o que alguém está a dizer em tempo real.

Os três modelos já estão disponíveis para programadores na Realtime API, com preços que começam nos 0,017 dólares por minuto para o GPT-Realtime-Whisper; 0,034 dólares para o GPT-Realtime-Translate; e 32 doláres por um milhão de tokens de inputs de áudio para o GPT-Realtime-2. 

Assine a newsletter do TEK Notícias e receba todos os dias as principais notícias de tecnologia na sua caixa de correio.