Julia Monteiro
Julia Monteiro
Inteligencia Artificial · 9 de setembro de 2016 · 2 min de leitura ·

Inteligência artificial do Google aprende a imitar vozes humanas e música

Inteligência artificial do Google aprende a imitar vozes humanas e música

O que você precisa saber

A DeepMind, empresa de inteligência artificial do Google, apresentou hoje a WaveNet, uma rede neural voltada para gerar ondas de som. Dentre os talentos do programa, ele é capaz de imitar com precisão vozes humanas e até mesmo criar pequenas peças musicais.

Normalmente, os programas que dão voz a computadores usam tecnologia concatenativa de texto para voz. Por esse método, diferentes sílabas são juntadas para compor uma frase. Essa técnica é relativamente simples, mas produz resultados pouco convincentes – ela soa muito como uma máquina falando. Serviços como o Google Now e o Google Tradutor usam esse tipo de síntese vocal.

O modelo da WaveNet, por sua vez, é generativo: ele é feito por uma rede neural treinada a partir de inúmeras amostras de ondas sonoras de gravações vocais. Com a sua base de treinamento, a rede neural consegue pegar um texto e “prever”, com base no seu conjunto de treinamento, como ele deve soar.

Pode parecer um processo tranquilo, mas ele é extremamente exigente para os computadores. Vídeos, por exemplo, são compostos de 24 a 60 quadros por segundo, por exemplo. Para reproduzir uma onda de áudio, porém, o computador precisa gerar até 16 mil amostras por segundo, de acordo com a Bloomberg. Cada uma dessas amostras é gerada com base no que veio antes e em exemplos do conjunto mde treinamento, resultando em algo como a onda sonora abaixo:

De acordo com a empresa, a WaveNet conseguiu gerar imitações mais convincentes de vozes humanas do que as melhores versões de duas tecnologias diferentes de geração de voz a partir de texto. Tanto em inglês quanto em mandarim, usuários avaliaram melhor a fala da WaveNet do que a dessas outras duas tecnologias. Abaixo, é possível ouvir alguns exemplos de frases geradas pela rede neural:

Essas frases são produzidas quando a inteligência artificial é solicitada a gerar voz a partir de textos. No entanto, ela também é capaz de funcionar sem que nenhum texto presente. Nesse caso, ela produz sons estranhos que soam como o que a máquina imagina que seja uma linguagem humana quando não há texto presente. Exemplos de sons desse tipo podem ser ouvidos neste, neste e neste link.

Compartilhe