Teknoloji

Ekranınızı okuyan Alibaba yapay zekası gerçek telefonlarda yüz değeri 92 başarı elde ediyor ve kendi donanımınızda çalışıyor

Susan Hill

Alibaba’nın Qwen-UI-Agent’ı uygulamalarınıza özel bir erişim gerektirmiyor. Ekranı okuyor, üzerindekileri tanımlıyor ve tıklıyor; mesajlaşmadan belge düzenlemeye kadar görevleri yalnızca görsel algıyla yerine getiriyor. Model ağırlıkları — MAI-UI-2B ve MAI-UI-8B — bu hafta Hugging Face’te yayınlandı ve sistemi GPU’su olan her geliştiricinin erişimine açık hale getirdi.

Kıyaslamalar somut. Mobil ajan değerlendirmesinin standardı olan MobileWorld’de Qwen-UI-Agent %82,1 puan alarak GPT-5.6’yı 12 puan, Claude Opus 4.8’i ise 14,6 puan farkla geçti. Fark küçümsenecek gibi değil — benzer Batı sistemleri aylardır aynı testte %70’lerin alt-orta seviyelerinde takılı kaldı. Gerçek cihaz testlerinde — görevler emülatörler yerine gerçek Android cihazlarda çalıştırıldı — puan %92,2’ye yükseldi. Daha kapsamlı bir gerçek telefon değerlendirmesi olan AndroidDaily’de model %97,5’e ulaştı. Masaüstü bilgisayar kullanımı için OSWorld-Verified ile ölçüldüğünde %79,5 puan aldı; hem GPT-5.5 hem de Gemini 3.1 Pro’nun önünde.

Alibaba, modeli 150 farklı uygulama çalıştıran 100’den fazla gerçek mobil cihazdan gelen verilerle eğitti, ardından kendi kıyaslaması olan MobileWorld-Real’i, laboratuvar dışında performansı doğrulamak için 400’den fazla görevle oluşturdu. Masaüstü görevlerinin kabaca %40’ı, görsel tıklamaların yanı sıra toplu komut satırı işlemlerini içeriyordu; bu, gerçek bilgi işlemin nasıl çalıştığını yansıtan, demoların nasıl sahnelendiğini değil, bir tasarım tercihi.

İş akışına bir güvenlik katmanı yerleştirilmiş. Model, yasa dışı veya yüksek riskli olarak işaretlediği görevleri reddediyor ve hassas işlemlerde — ödemeler, veri silme, gizlilik yetkilendirmeleri — durarak devam etmeden önce açık kullanıcı onayı istiyor. Sistem, yaklaşık 10.000 eşzamanlı simüle edilmiş ortamda eğitilmiş pekiştirmeli öğrenme kullanarak 100 adımdan uzun dizileri yönetiyor.

Kıyaslama puanları daha zor soruları açık bırakıyor. Qwen-UI-Agent, yapılandırılmış görevlerde değerlendirildi; gerçek telefon kullanımı kesintilerle dolu, bildirimlerle tıka basa ve uyarı vermeden arayüzlerini güncelleyen uygulamalar içeriyor. Ekran okuyan yapay zeka ayrıca Alibaba’nın teknik raporunda ele alınmayan bir gizlilik sorusunu gündeme getiriyor: ekranınızdaki her pikseli işleyen bir model, bankacılık bilgilerine, özel mesajlara ve çoğu kullanıcının üçüncü taraf bir sisteme vermeyi hiç düşünmediği verilere erişebiliyor. Üçüncü taraf dağıtımlarda bu verilere ne olduğuna dair yönergeler bulunmuyor.

Proje GitHub’da Tongyi-MAI/MAI-UI adresinde barındırılıyor; model ağırlıkları şu anda Hugging Face’te. Henüz ticari bir API veya dağıtım fiyatlandırması duyurulmadı. Qwen-UI-Agent için bir sonraki test bir kıyaslama değil — açık ağırlıklar üzerinde çalışan geliştiricilerin, Alibaba’nın laboratuvarda kaydettiğini üretimde eşleştirip eşleştiremeyeceğidir.

Etiketler: , , , , ,

Tartışma

S kadar yorum var.