Llava nasıl çalışır? İşte görseller için açık chatbot testimiz - Dünyadan Güncel Teknoloji Haberleri

Llava nasıl çalışır? İşte görseller için açık chatbot testimiz - Dünyadan Güncel Teknoloji Haberleri
Care burun spreyinin dozajı, genellikle günde iki veya üç kez olmak üzere ihtiyaç halinde burun deliklerine püskürtülmektir Bir metnin okunması ve çevrilmesi belki de pek yararlı olmayabilir ) Ama bilmemesi gerekiyor çünkü gazete okumuyor Ancak kumaşın doğru ütülendiğinden emin olmak, kalitesini ve görünümünü korumak için etiket üzerindeki talimatlara uymak şarttır Görüntü analizi çok daha ilginç Tipik bir örnek, ona açık bir buzdolabının fotoğrafını göstermek ve ardından şuna benzer bir soru sormaktır: “Biri vejetaryen olan üç kişilik bir akşam yemeği için bu malzemelerle hangi tarifleri önerirsiniz?” Testimizin cevabı: “Akşam yemeği menüsü için işte bir öneri: 1 Genelde olgunlaşmamış ama çok ilginç ürünler sergiliyorlar Sistemin etkileşimli olduğunu unutmayın, tıpkı ChatGpt ve benzeri gibi: konuşmayı sürdürürken ileri geri hareket edebiliriz, ilgili diğer şeyleri isteyebiliriz
“Görüntünün sahte olduğunu gösteren bazı ipuçları var Cümlenin aniden durması bu dil modellerinde tipik bir hatadır Izgara tavuk veya sebze şiş…” – Ayrı bir kapta çeri domatesleri, dilimlenmiş biberleri ve dilimlenmiş salatalıkları karıştırın Ayrıca ona bir gömlek etiketi veya benzeri bir şey verebilir ve bu sembollerin ne anlama geldiğini veya daha doğrudan, bu sembollere dayanarak onu ütülemenin veya beyazlatmanın mümkün olup olmadığını sorabiliriz Nedir, nasıl kullanılır, dozajı diye sorduk Bu burun spreyinin kullanımı burun tıkanıklığını gidermek ve soğuk algınlığı ve grip semptomlarında geçici bir rahatlama sağlamaktır Vejetaryen makarna salatası hafif ve canlandırıcı bir seçenektir Bu, yeni açık kaynaklı “çok modlu” sohbet robotu Llava “Etiket üzerindeki sembollere bakılırsa gömleğin ağartılmaması gerektiği anlaşılıyor Üstelik sadece geçen yıl Llava’nın yanı sıra Bing, Bard ve ChatGpt4V de geldi Samsung’dan Bixby bunu zaten yapıyor, akıllı telefondan Google Lens ise kesinlikle daha doğrudan ve kullanışlı Herkesin güçlü ve zayıf noktaları vardır Bunu iki örnek daha takip ediyor: “Bu yemek, farklı tatları ve beslenme tercihlerini karşılayan çeşitli tatlar ve dokular sunuyor


“Fakat bu görüntü doğru mu, yanlış mı?” Son olarak, duman bulutunun ve çevredeki ortamın genel görünümü yapay görünüyor ve bu da bunun sahte bir fotoğraf olduğu hipotezini daha da destekliyor Llava kesinlikle daha acildir; belki de (çok) daha az kullanıcı sayısının etkisi vardır ”

Genel görüş

Pek çok uzman, multimodal botun belki de bu sistemlerin geleceği olduğuna dikkat çekiyor Ona, Pentagon’a yönelik sahte bir saldırıyı yeniden üreten, yapay zekayla oluşturulmuş bir fotoğraf veriyoruz – Üçüncü bir kapta pişmiş makarnayı, sebzeleri ve zeytinyağı, balzamik sirke, tuz ve karabiberden oluşan sosu karıştırın ”İyi; Ancak birkaç düzine saniye sürdü ve birkaç kez çöktü 2 Aslında ağartmayın diyen bir sembol vardı Ücretsiz olarak deneyebilirsiniz Burada ” Vesaire Aslında kullanışlılıkları ve etkinlikleriyle şaşırtabilirler, hatta aniden hayal kırıklığına uğratabilirler Beyazlatma sembolü bir üçgendir ve içinden geçen bir çizgi beyazlatmanın tavsiye edilmediğini gösterir ”
Mükemmel: yararlı ve hatta bilgilendirici Vejetaryen Makarna Salatası: – Makarnayı (spagetti, penne veya başka türde) pişirin ve bir kenara koyun

Llava nedir ve nerede bulunur?

Llava, büyük bir multimodal model olan Büyük Dil ve Görme Asistanı anlamına gelir bir grup araştırmacı tarafından eğitildi Llava burada pek başarılı olamadı: “Bu gömleği bu etiketle beyazlatabilir miyim?” “Etiket üzerinde ütüleme talimatlarının bulunması, kumaşın ütülenmeye uygun olduğunu gösterir (ve bunun bununla ne alakası var? Ed Birincisi, duman bulutu çok büyük görünüyor ve boyut olarak gerçekçi değil; bu da kontrol edilemeyen yangınlar veya volkanik patlamalar gibi doğal olaylara özgü değil Aynı görseli Bing Chat’te de denedik – bu da artık multimodal – ve yanıt daha iyi oldu

Llava’nın yapabilecekleri

Llava’ya bir resim gönderiyoruz ve ona -şimdilik sadece İngilizce olarak- bununla birlikte bir şeyler soruyoruz
Ve yine de: cevap bizi şaşırtıyor Genel görsel ve dilsel anlayış için bir görüntü kodlayıcı ile bir LLM (“geniş dil”) modelini bağlayın Telefonumuzdan Llava’ya gittik ve masamızın üzerinde bulundurduğumuz burun spreyinin doğrudan arayüz üzerinden fotoğrafını çektik Ağartma konusunda verilen bilgilere göre kumaşın ağartılıp ağartılamayacağını belirlemek mümkün değildir ”
Sahte olduğunu nereden biliyorsun? Ona soruyoruz Sahte haberlerle ilgili olduğu gibi Kişisel veya ticari nedenlerle multimedya verilerinin analiz edilmesine yönelik bir sistem olarak yaygın uygulamasını bulacak bir teknolojinin muhtemelen henüz başlangıcındayız



genel-18

Son test, “tıbbi” Genel Bilgiler Cevap: “Resimde bir burun tıkanıklığı giderici olan Care Nazal Sprey şişesi gösterilmektedir Bilinen bir yalan haber – İsteğe bağlı olarak her şeyi tatlandırmak için biraz rendelenmiş parmesan ekleyin İkinci olarak, duman bulutunun bir binanın önünde olduğu belirtiliyor ancak binanın detayları açıkça görülemiyor, bu da bunun dijital olarak manipüle edilmiş bir arka plan olduğuna işaret ediyor olabilir Paket üzerindeki talimatlara uymak ve dozaj veya kullanıma ilişkin özel tavsiyeler için bir sağlık uzmanına danışmak önemlidir Dahası, testimizde her seferinde yalnızca birkaç saniye içinde yanıtlar gördük Üç olası işlev vardır: nesneleri veya bir görüntünün içeriğini tanımak; OCR, yani görüntüde bulunan kelimelerin okunması; modelin bir bilgi tabanına bağlandığı ve bu nedenle bize tavsiyelerde bulunabildiği ve değerlendirmelerde bulunabildiği görüntü analizi
“Bu görüntü büyük bir duman bulutunun sahte fotoğrafıdır ve muhtemelen sanatsal veya eğlence amaçlı yaratılmıştır