Teknoloji

ElevenLabs v4 sesinizi 10 saniyelik kayıtla kopyalıyor ve 90 dilde konuşturuyor

Susan Hill
Bizi Google'a ekleyin

ElevenLabs, yazılı metni yazarın istediği yerde kahkaha, iç çekiş ya da öfkeli bir Fransız aksanıyla seslendiren metinden konuşmaya modeli Eleven v4’ü kullanıma sundu. Anında ses klonlama özelliği, sesli mesajdan bile kısa bir kayıtla çalışıyor; klonlanan ses de kendi tınısını koruyarak onlarca dilde konuşabiliyor. Ücretsiz ElevenLabs hesabı olan herkes bu özelliği kullanabiliyor.

Sesle üretim yapanlar için bu, günler süren işleri ortadan kaldırıyor. Bir podcast yayıncısı bir bölümü kendi sesiyle Japoncaya dublajlayabilir, bağımsız bir oyun geliştiricisi stüdyo ayarlamadan her küçük karaktere kendine özgü bir konuşma biçimi verebilir, sesli kitap anlatıcısı da senaryoya doğrudan bir duraklama ya da kıkırdama ekleyebilir. Madalyonun öteki yüzü de bir o kadar somut: Bir sesli mesaj, görüntülü görüşmeden alınmış bir kesit ya da herkese açık bir gönderiden birkaç saniyelik kayıt, artık birinin inandırıcı ses kopyasını üretmeye yetecek ham malzeme demek.

Asıl değişiklik, kontrolün kullanıcıya geçmesi; klonlama içinse yalnızca 10 saniyelik ses yeterli. ElevenLabs’in önceki modelleri metni akıcı biçimde okuyordu ama nasıl bir duygu vermeleri gerektiğini kendileri tahmin etmek zorundaydı. Sürüm 4, [laughs] ya da [said angrily in French accent] gibi köşeli parantez içinde yazılan sahne yönergelerini ve [light rain] ya da [phone buzzing] gibi arka plan seslerine ilişkin ipuçlarını da algılıyor. Şirket, modelin çevresindeki bağlamdan tonlamayı ve konuşma temposunu da çıkardığını, bu nedenle gergin bir sahnedeki repliğin herhangi bir etiket eklenmeden de gergin duyulduğunu söylüyor. Birden fazla konuşmacının yer aldığı sahnelerde her ses, uzun bölümler boyunca tutarlılığını koruyor. Bu, seslerin bir bölüm boyunca giderek değişme eğiliminde olduğu sentetik anlatımın zayıf noktalarından biriydi.

TechCrunch’a göre dil desteği, önceki sürümdeki 70 dilden 90’ın üzerine çıkarken ElevenLabs özellikle Japonca, Brezilya Portekizcesi, Mandarin ve Kantonca dillerindeki kalite artışını öne çıkardı. Klonlanan ses dil değiştirirken de kimliğini koruyor; yani İspanyolca konuşan birinin klonu Almanca bir metni okuduğunda, Almancayı ana dili Almanca olan biri gibi aksanla ama o kişinin sesiyle konuşuyor. İkinci model v4 Turbo ise sesli asistanlar ve çağrı merkezi çalışanları için tasarlandı. Yaklaşık 150 milisaniyede konuşmaya başlıyor; bu, iki kişinin konuşma sırası kendisine geldiğinde verdiği araya yakın bir süre. Ayrıca arkasındaki sohbet robotu yanıtını yazmayı bitirmeden konuşmaya başlayabiliyor.

Bu pazarda yalnızca ElevenLabs yok. Google, OpenAI, Cartesia, Deepgram ve Fish Audio da aynı geliştiricilere sentetik sesler satıyor. Lansmandan saatler sonra bağımsız kıyaslama şirketi Artificial Analysis, dinleyicilerin anonim örnekleri yan yana değerlendirip puan verdiği ses sıralamasında v4’ü ilk sıraya koydu. ElevenLabs ayrıca rakiplerle yapılan kör karşılaştırmalarda dinleyicilerin yaklaşık dörtte üçünün v4’ü tercih ettiğini söylüyor; bu oran şirketin kendi testlerinden geliyor.

Uyarılar, 10 saniye meselesiyle başlıyor. ElevenLabs, klon oluşturmak için yüklenen sesin sahibinden izin alınması gerektiğini, kendi araçlarıyla üretilen sesleri tespit edebilen herkese açık bir sınıflandırıcı kullandığını ve bazı siyasi figürlerin seslerinin klonlanmasını doğrudan engellediğini söylüyor. Bu denetimler gelişigüzel kötüye kullanımı önlüyor, ancak ses kaydını yükleyen kişinin doğruyu söylemesine dayanıyor. Bir dolandırıcının sahte bir acil durum araması düzenlemesi içinse bir yakınının sesinden kısa bir örnek alması yeterli. Unite.AI’ın paketlere ilişkin incelemesine göre ücretsiz kullanım da sınırlı: Ayda yaklaşık 10 dakikalık ses üretilebiliyor; ücretli paketler ise ayda 6 dolardan başlıyor.

Eleven v4 ve v4 Turbo, 28 Eylül’de ElevenLabs’in içerik üreticilerine yönelik uygulamasında, ajan platformunda ve geliştirici API’sinde kullanıma açıldı. Merkezi Londra’da bulunan şirket, şubat ayında Sequoia’dan 11 milyar dolar değerleme üzerinden 500 milyon dolar yatırım aldı. TechCrunch’ın haberine göre yıllıklandırılmış geliri 600 milyon doları aştı. CEO Mati Staniszewski, TechCrunch’a şirketin önümüzdeki yıllarda borsaya açılmayı hedeflediğini, ancak bunun için bir tarih vermediğini söyledi.

İçerik üreticileri için 90 dilde, tam zamanında kahkaha atan bir ses, tarayıcı sekmesinin içindeki bir kayıt stüdyosu demek. Diğer herkes içinse telefonda tanıdık bir ses para istediğinde telefonu kapatıp geri aramak için bir neden daha.

Etiketler: , , , , ,

Bizi Google'a ekleyin

Tartışma

S kadar yorum var.