Birkaç Dakikada Yapay Zekanın Frenlerini Söken Araç: Heretic

Editör
Birkaç Dakikada Yapay Zekanın Frenlerini Söken Araç: Heretic

Popüler yapay zeka sohbet robotlarına bazı tehlikeli sorular sorduğunuzda, büyük olasılıkla “Bu yasa dışı, zararlı veya politika ihlali” yanıtını alırsınız.

Ancak hiçbir zaman kullanıcıya ret yanıtı vermeyen bir tür yapay zeka modeli daha var. Son aylarda bu modeller çok daha erişilebilir ve popüler hale geldi.

Alice adlı yapay zeka güvenlik şirketinin CEO’su Noam Schwartz, “Herkes kendi son teknoloji modelini indirip çalıştırabilir ve bunu harika şeyler için de korkunç şeyler için de kullanabilir” diyor.

Modellere ‘Hayır’ Demeyi Öğretmek

OpenAI, Google, Anthropic ve xAI gibi büyük yapay zeka şirketleri, kendi tescilli modellerini zararlı veya uygunsuz görülen istekleri reddedecek şekilde eğitiyor. Bu yöntemler her zaman işe yaramıyor. Bazı zararlı talepler cevapsız kalmıyor ya da masum istekler gereksiz yere reddediliyor.

Ancak guardrail’leri (güvenlik bariyerleri) çok daha kolay kaldırılabilen bambaşka bir model sınıfı daha var. Bunlar açık ağırlıklı modeller (open-weight models) olarak biliniyor. DeepSeek gibi Çin merkezli girişimlerin yanı sıra OpenAI ve Alibaba gibi teknoloji devleri de bu tür modeller üretiyor.

Model Güvenlik Bariyerlerini Kaldırmak Hiç Olmadığı Kadar Kolay

Açık ağırlıklı modellerin güvenlik bariyerleri zayıflatılabiliyor veya tamamen kaldırılabiliyor. Bunun nedeni, model geliştiricilerinin model ağırlıklarını (modelin bilgiyi nasıl işleyeceğini belirleyen parametreler) halka açık hale getirmesi.

Son zamanlarda geliştirilen “abliteration” (yok etme) adlı yöntem, yapay zeka ve ulusal güvenlik araştırmacılarının dikkatini çekti. İnsanlar model ağırlıklarını değiştirerek modele “hayır” deme yetisini tamamen söküp atabiliyor.

Açık kaynak yapay zeka modellerini barındıran Hugging Face platformunda şu anda 6.000’den fazla abliterated (bariyerleri kaldırılmış) model listeleniyor. 2024’te bu sayı sadece 600 civarındaydı.

Dahası, yeni araçlar bu işlemi çok kolaylaştırıyor. Heretic adlı uygulama, abliteration sürecini otomatikleştiriyor. Kullanıcının tek yapması gereken iki satır talimat vermek ve süreç sadece birkaç dakika sürüyor.

Bariyersiz Modeller Hem Faydalı Hem Tehlikeli

Bu modeller kullanıcıların kendi bilgisayarlarında çalıştığı için nasıl kullanıldıklarına dair kapsamlı bir tablo çıkarmak zor. Ancak endişe verici örnekler var:

  • X platformundaki bazı hesaplar, abliterated modelleri por***rafi üretmek için kullandığını söyledi.

  • Terör örgütü yanlısı bir sohbet odasındaki bir kişi, “ABD’deki bir yerleşim yerini yok etmek” için gereken şeyleri araştırmak üzere “sansürsüz” bir yapay zeka kullandığını iddia etti.

  • Bir siber suç forumunda kullanıcı, dolandırıcılık aramaları yapmak için bir yapay zeka modelinin güvenlik bariyerlerini nasıl aşabileceğini sordu.

NCITE direktörü Samuel Hunter, “Bazı abliterated modellerin ‘Bir zararlı madde yapmak ne harika bir fikir’ gibi coşkulu kişilikleri gerçek zamanlı görmek insanı sarsıyor” diyor.

Meşru Kullanımlar da Var

Yapay zeka güvenlik CEO’su Schwartz’a göre, bu modellerin kötü niyetli aktörleri yakalamak ve siber güvenlik araştırmalarına yardımcı olmak gibi meşru kullanımları da bulunuyor. Kolluk kuvvetleri, olası terör saldırılarını simüle etmek için değiştirilmiş bir model kullanabilir.

Heretic’in geliştiricisi Philipp Emanuel Weidmann ise yapay zekayı bir arama motoruna benzetiyor: “Suçluların bunları kullanması, yapay zeka modellerinin doğasının bir sonucu: yani araçlar.”

Şu anda açık ağırlıklı modeller, en gelişmiş kapalı ağırlıklı modeller kadar yetenekli değil. Ancak İngiliz hükümetinin hazırlattığı rapora göre yetenek farkı bir yıldan daha az.

Riskleri Azaltmanın Bedelleri Var

Bir çözüm, güvenlik bariyerlerini kurcalamaya karşı daha dayanıklı hale getirmek. Biyolojik silah yapımıyla ilgili içerikleri eğitim verilerinden filtrelemek, modelin zararlı bilgilerle yanıt verme sıklığını azaltabiliyor.

Diğer bir çözüm ise bariyersiz modellere erişimi kısıtlamak. Ancak rapora göre bu önlemlerin kusurları var: “Tıp veya araştırmadaki faydalı uygulamaları mümkün kılan özellikler, zarar için yeniden kullanılabilir. Ağırlıklar halka açıldıktan sonra meşru ile kötü niyetli kullanımı ayırt etmek zorlaşıyor.”

Weidmann, “Yapay zekada çok fazla güç var. Kısıtlanmamış modeller sadece güçlülerin kullanımına açık olursa, bu güç yapısını sonsuza kadar pekiştirir” diyor.

Etiketler:

Bir yanıt yazın