Yapay zekâ güvenliği: Hangi verileri paylaşmamalısınız?
Tüketicilere yönelik dil modellerini güvenli kullanmanın temeli, bu araçlara girilen verileri sıkı biçimde kontrol etmektir. Çünkü herkese açık yapay zekâ araçlarına gönderilen bilgiler, kullanıcının yerel ortamından çıkar. Gizli verilerin yapay zekâya girilmesi; veri sızıntısı, ticari sırların ifşası ve kişisel verilerin korunmasına ilişkin kuralların ihlali riskini taşır. Bu nedenle yapay zekâyla her etkileşimi, bilgileri kamuya açık bir yerde yayımlıyormuş gibi değerlendirmek gerekir.
Yapay zekâya hangi veriler girilmemeli?
Herkese açık modellerde aşağıdaki veri türleri kesinlikle işlenmemelidir:
- kişisel veriler – müşterilerin, çalışanların veya sizin adınız, soyadınız, adresiniz, T.C. kimlik numaranız, telefon numaranız ve e-posta adresiniz;
- tıbbi kayıtlar – KVKK veya HIPAA gibi sıkı yasal düzenlemelere tabi olan hastalık geçmişi, tetkik sonuçları ve hasta tanıları;
- gizli şirket bilgileri – yayımlanmamış mali raporlar, pazarlama stratejileri, müşteri veritabanları ile birleşme, satın alma veya işten çıkarma planları;
- ticari sırlar – yazılım kaynak kodları, üretim formülleri, özgün algoritmalar ve şirket içi teknik belgeler;
- şifreler ve erişim bilgileri – API anahtarları, oturum açma bilgileri, yetkilendirme belirteçleri, ödeme kartı bilgileri ve her türlü şifreleme anahtarı;
- telif hakkıyla korunan materyaller – kullanımı için gerekli lisansa sahip olmadığınız kitapların, ücretli bilimsel makalelerin veya senaryoların tam metinleri;
- yasa dışı içerikler – şiddeti veya nefreti teşvik eden materyaller ve yürürlükteki hukuka aykırı eylemlere ilişkin talimatlar.
Yapay zekâya girilen verilere ne olur?
Bulut hizmeti sağlayıcılarına gönderilen veriler, birden fazla aşamada işlenir ve analiz edilir. Bu bilgilerin yaşam döngüsü, yanıtın oluşturulmasıyla sona ermez.
Modellerin eğitilmesi
Üretken yapay zekâ araçlarının standart tüketici sürümlerine girilen veriler, çoğu zaman modellerin geliştirilmesinde kullanılır. Bu, girilen bilgilerin sinir ağının ağırlıklarını etkileyebileceği ve teorik olarak ileride bambaşka bir kullanıcıya verilen yanıtta yeniden üretilebileceği anlamına gelir.
İnsan incelemesi ve moderasyon
Yapay zekâ sistemlerinde otomatik işlemenin yanı sıra güvenlik filtreleri de bulunur. Algoritma bir sorguyu şüpheli bulursa (örneğin kullanım koşullarını ihlal ettiğini değerlendirirse) konuşma işaretlenip insan incelemesine yönlendirilebilir. Bu durumda hizmet sağlayıcının çalışanları veya dışarıdan görev alan veri etiketleyicileri, moderasyon mekanizmalarını iyileştirmek amacıyla girilen içerikleri doğrudan görebilir.
Veri saklama ve yedekler
Yapay zekâ sağlayıcıları; hizmet sürekliliği, hata teşhisi ve sonraki oturumlarda bağlamın korunması için konuşma kayıtlarını sunucularında saklar. Kullanıcının arayüzden bir sohbeti silmesi, bilgilerin sunuculardan hemen kaldırıldığı anlamına çoğu zaman gelmez. Veriler, sağlayıcının yedekleme sistemlerinde belirli bir süre daha kalır. Bu da bulut altyapısına yönelik başarılı bir siber saldırıda gizli bilgilerin açığa çıkma riskini ciddi ölçüde artırır.
Bireysel ve kurumsal hesaplar: Koruma düzeyleri arasındaki farklar
Yapay zekâda veri güvenliği, abonelik türüne ve hizmetin nasıl kullanıma sunulduğuna göre önemli ölçüde değişir.
Ücretsiz ve ücretli standart bireysel hesaplarda birçok popüler hizmet, gönderilen bilgileri varsayılan olarak model eğitimi için işler. Bu nedenle gizli kaynaklar paylaşıldığında her oturum, bu bilgilerin kontrolsüz biçimde açığa çıkması riskini taşır.
İşletmelere ve büyük kuruluşlara yönelik ortamlarda (örneğin Enterprise hesapları veya Microsoft Azure, AWS ve Google Cloud gibi sağlayıcıların API hizmetleri üzerinden özel bulutlarda kullanılan çözümler) koruma standartları daha sıkıdır. Sağlayıcılar bu ortamlarda ISO 27001, SOC 2 ve KVKK gibi güvenlik ve veri koruma gerekliliklerine uygunluk sunar; ayrıca SLA/DPA sözleşmelerinde müşteri verilerinin herkese açık temel modelleri eğitmek için kullanılmayacağını belirtir. Bu ortamlarda girilebilecek verilere ilişkin kısıtlamalar daha esnek olabilir. Yine de risk yönetimi politikası ve erişim kontrolleri gerekir.
Yapay zekâya hangi bilgiler güvenle girilebilir?
Kısıtlamalara rağmen yapay zekâyla işlenebilecek pek çok bilgi vardır. Bunlardan bazıları şunlardır:
- kamuya açık materyaller – açık kaynaklı makaleler, blog yazıları, herkesin erişebildiği pazar raporları, mevzuat metinleri ve Wikipedia gibi internet sitelerindeki içerikler;
- gizli olmayan bilgiler – genel yönergeler, kuramsal kavramlarla ilgili sorular, dil bilgisi ve yazım kuralları, matematik denklemleri ve sözlük sorguları;
- anonimleştirilmiş belge parçaları – özgün değişkenleri, anahtarları, müşteri adları ve şirket içi mimariye ilişkin ayrıntıları tamamen çıkarılmış yazı şablonları, sözleşme örnekleri ve kod parçaları;
- kendi yazdığınız metinler – hassas iş verileri içermeyen e-posta taslakları, sosyal medya paylaşımları, sunum taslakları ve makaleler;
- açık veri kümeleri – analiz ve biçimlendirme çalışmalarında kullanılabilecek sentetik veriler veya kamuya açık depolardaki istatistikler.
Yapay zekâya göndermeden önce mesajlar ve veriler nasıl anonimleştirilir?
Gizli belgeler bir dil modeline gönderilmeden önce hazırlanmalı ve hassas bilgilerden arındırılmalıdır. Böylece gizli verilerin açığa çıkma riski azaltılarak metin üzerinde çalışılabilir.
Kimlik belirleyici bilgileri kaldırma ve yer tutucularla değiştirme
Bu yöntemde hassas veriler, gerçek bilgilerin yerine geçen yapay ifadelerle değiştirilir. Örneğin “Ayşe Yılmaz” adı “[Müşteri_1]” etiketiyle, “ABC Şirketi” adı ise “[Kurum_A]” etiketiyle değiştirilebilir. Böylece belgenin yapısı, söz dizimi ve bağlamı dil modeli için korunurken gerçek kişi veya kuruluşun belirlenmesi önlenir.
Hassas bilgileri maskeleme teknikleri
Maskeleme, kritik karakter dizilerinin doğrudan gizlenmesidir; genellikle bunlar özel karakterlerle değiştirilir (örneğin kart numarası 4532 **** **** ****). Verileri genelleştirmek de etkili bir yöntemdir: Kesin bir değer vermek yerine (örneğin 45.000 TL maaş), bir aralık kullanılabilir (örneğin “40.000–50.000 TL arası maaş”). Bu, kişinin veya bilginin yeniden tanımlanması riskini azaltır.
Süreci otomatikleştirme: DLP ve RegEx araçları
Uzun metinlerden bilgileri elle çıkarmak, bazı ayrıntıların gözden kaçmasına yol açabilir. Profesyonel ortamlarda düzenli ifadelere (RegEx) dayalı betikler veya DLP (Veri Kaybı Önleme) sistemleri kullanılır. Bu araçlar, istem gönderilmeden önce metni otomatik olarak tarayabilir; T.C. kimlik numarası, vergi kimlik numarası (VKN), e-posta adresi ve banka hesap numarası biçimindeki dizileri tespit ederek engelleyebilir veya değiştirebilir.
Yapay zekâyla paylaşılan bilgiler: Verilerinizle model eğitimini nasıl kapatabilirsiniz?
Yapay zekâya bilgi girmenin risklerini azaltmanın bir yolu da aracın ayarlarını düzenlemektir. Çoğu sağlayıcı, içeriklerin model eğitiminde kullanılmasını devre dışı bırakma seçeneği sunar.
- ChatGPT (OpenAI) – hesap ayarlarındaki Settings bölümünden “Data controls” sekmesine giderek “Improve the model for everyone” seçeneğini kapatabilirsiniz. Böylece girdiğiniz metinlerin model eğitiminde kullanılması devre dışı bırakılır. Mevcut arayüzde bu işlem, konuşmaları kullanıcı görünümünden kaldırmaz; sohbet geçmişi korunur. Bu ayardan bağımsız olarak OpenAI, kötüye kullanımın izlenmesi ve güvenlik amacıyla kayıtları kalıcı olarak silmeden önce 30 gün boyunca sunucularında saklar.
- Gemini (Google) – gizlilik ayarlarından “Gemini Apps Activity” özelliğini kapatabilirsiniz. Böylece yeni konuşmalar Google hesabınıza kaydedilmez ve model eğitiminde kullanılmaz. Ancak bu değişiklik, kayıtları sağlayıcının altyapısından hemen silmez: Google, hizmet güvenliği amacıyla bunları en fazla 72 saat saklar.
- Claude (Anthropic) – ücretsiz ve standart tüketici sürümlerinde, girilen verilerin algoritmaları geliştirmek için kullanılmasına yönelik ayarlar şu anda varsayılan olarak etkindir. Bu, Anthropic’in kullanıcı konuşmalarını eğitim amacıyla kullanmadığını özellikle vurguladığı ilk dönemlere göre önemli bir değişikliktir. Bu kullanımı kapatmak için hesap ayarlarındaki gizlilik bölümüne gidip “Help improve Claude” seçeneğini devre dışı bırakın.
Gizlilik ayarlarında yapılan değişikliklerin ve model eğitimine verilen iznin geri çekilmesinin yalnızca bundan sonraki kullanımlar için geçerli olduğunu unutmayın. Değişiklikten önce sisteme gönderilip makine öğrenimi sürecine dâhil edilmiş bilgiler, sinir ağının yapısında kalır.
Özet
- Tüketicilere yönelik yapay zekâ araçlarıyla her etkileşimi, bilgileri kamuya açık bir yerde yayımlıyormuş gibi değerlendirin. Kişisel verileri, tıbbi kayıtları, şifreleri ve ticari sırları bu araçlara girmeyin.
- Gönderilen bilgiler; model eğitimi, moderasyon ve harici sunucularda yedekleme dâhil olmak üzere birden fazla işlemden geçebilir.
- Verileri önceden anonimleştirmek, hassas karakter dizilerini maskelemek, bilgileri yer tutucularla değiştirmek ve DLP araçlarından yararlanmak riski azaltır.
- Enterprise hesapları ve işletmelere özel bulut ortamları daha sıkı koruma standartları sunar; bu ortamlarda müşteri verileri model eğitimi için kullanılmaz.
- Gizlilik ayarlarını değiştirmek ve model eğitimini kapatmak yalnızca gelecekteki kullanımları etkiler; daha önce eğitim sürecine dâhil edilmiş verileri geri almaz.
Bir yanıt yazın