Asosiy faktlar

  • Google Research 2026‑yil 26‑iyunda Multi‑Token Prediction (MTP) texnikasini e’lon qilib, Gemini Nano kabi on‑device modellarda ba’zi vazifalarda ~50% gacha tezlashish va yuz MB darajasida RAM tejashni ko‘rsatdi.
  • Android platformasi on‑device modellarga tizim darajasida kirish uchun AICore/ML Kit kabi xizmatlarni taqdim etadi; developer hujjatlari 2026 yil o‘rtalarida yangilandi.
  • Qualcomm va boshqa chip yetkazib beruvchilar on‑device AI platformalari va developer‑tooling (masalan, GenieX va Snapdragon ishlanmalari) orqali inferensni tezlashtiradi.
  • Jamoatchilik runtime va ilovalar (MLC Chat, PocketPal uslubi, Ollama‑tipidagi vositalar) telefon va planshetlarda mahalliy LLMlarni ishga tushirish imkonini beradi.
  • Praktik model hajmlari odatda ~0.55 GB dan 4.6 GB gacha; yuqori sifatli multimodal variantlar uchun 6–12+ GB RAM yoki undan ortiq qulay ishlashni ta’minlaydi.
  • Ba’zi optimallashtirishlar (MTP kabi) xotira bosimini taxminan ~130 MB ga kamaytirishi va ayrim vazifalarda tezlikni ~50% gacha oshirishi kuzatilgan.

On‑device AI nima?

On‑device AI — LLM va inferens jarayonini tashqi server o‘rniga telefon yoki planshetning o‘zida, ya’ni CPU/NPU/ISP darajasida bajarishdir. Natijada ma’lumotlar qurilmada qoladi va ba’zi hollarda internetga ulanmasdan ham AI funksiyalari ishlaydi. Biroq bu — qurilmaning xotirasi, saqlash joyi, NPU/CPU va batareyasiga qo‘shimcha yuk demak.

Asosiy komponentlar va tizim bloklari

- Model va hajmi: on‑device uchun mo‘ljallangan modellarning namunalari — Gemini Nano va unga o‘xshash optimallashtirilgan LLMlar. Amaliy modellar hajmi odatda ~0.55 GB dan 4.6 GB gacha; yuqori sifatli multimodal variantlar uchun ko‘pincha 6–12+ GB RAM kerak bo‘ladi.

- Android AICore / ML Kit: Android tizimi AICore yoki ML Kit singari tizim xizmatlari orqali ilovalarga mahalliy modellarga tizim darajasida kirish imkonini beradi. Android hujjatlari va developer bloglarida 2026 yilda AICore va Gemini Nano uchun yo‘riqnomalar yangilangan.

- SoC va vendor runtimlari: Qualcomm va boshqa chip yetkazib beruvchilar on‑device inferensni tezlashtirish uchun platforma va developer‑tooling (masalan, Qualcommning GenieX va Snapdragon on‑device ishlanmalari) chiqaradi. Bunday runtimlar NPU/ISP dan samarali foydalanib ish unumdorligini oshiradi.

- Jamoatchilik runtime va ilovalar: MLC Chat, PocketPal tipidagi ilovalar va Ollama‑uslubidagi runtime’lar foydalanuvchilarga telefon yoki planshetda mahalliy LLMlarni ishga tushirish imkonini beradi; ularga oid qo‘llanmalar 2026 yilning bahor‑yozida kengaydi.

Google va optimallashtirishlar

Google Research 2026 yil 26 iyunda Multi‑Token Prediction (MTP) texnikasini taqdim qilib, Gemini Nano kabi on‑device modellarda inferensni tezlashtirish va xotira bosimini kamaytirishni ko‘rsatdi. Google hisobotiga ko‘ra MTP muayyan ish yuklarida Pixel 9 qurilmalarida ba’zi vazifalarda ~50% gacha tezlashish va bir nechta yuz megabayt darajasida RAM tejashni namoyish qilgan. Android developer hujjatlari ham on‑device yo‘riqnomalarini 2026 yil o‘rtalarida yangiladi.

Qanday qilib qurilmangizni sinash mumkin (bosqichma‑bosqich)

1) SoC va RAMni tekshiring: qurilmangizdagi SoC (masalan, Snapdragon) va uning NPU/AI akseleratori mavjudligini aniqlang; kamida 8 GB RAM yuqori sifatli lokal LLMlar uchun qulay hisoblanadi.

2) AICore/AI sozlamalarini qidiring: Sozlamalarda "AI xususiyatlari", "System/AI" yoki ilovalar ro‘yxatida com.google.android.aicore kabi paketlar bor‑yo‘qligini tekshiring. Bunday tizim xizmatlari bo‘lsa, ilovalar bilan yaxshiroq integratsiya bo‘ladi.

3) Ilovalarni o‘rnating va "local/offline" rejimini faollashtiring: MLC Chat, PocketPal uslubidagi ilovalar yoki community‑runtime ilovalarini o‘rnating; ilovaning sozlamalarida "local" yoki "offline" opsiyasini qidiring va modelni yuklash hajmini ko‘ring.

4) Model yuklab, oddiy joriy test bajaring: 1–3 daqiqalik matn generatsiyasi yoki sarhisob kabi so‘rovlarni bajarib ko‘ring; bu inferens davomida qurilmaning issiqlik va batareya sarfini kuzatish uchun yetarli.

5) Batareya va issiqlikni baholang: mahalliy inferens uzluksiz CPU/NPU yukini talab qilishi mumkin — qisqa 5–10 daqiqalik sinovda sezilarli batareya pasayishi va temperaturaning oshishi kuzatilishi mumkin. Doimiy yoki uzoq sessiyalar uchun bulut yordamchi rejimni qo‘llash o‘ylab ko‘riladi.

Qaysi ilovalar va runtimlarga e’tibor berish kerak

  • PocketPal va MLC Chat kabi ilovalar mahalliy model variantlarini qo‘llab‑quvvatlaydi; ilovalar model yuklash hajmini va offline rejimni ko‘rsatadi.
  • Ollama/MLC tipidagi runtime’lar ham telefonlarda yoki planshetlarda lokal LLMlarni ishga tushirishga yordam beradi.
  • Chip yetkazib beruvchilar (Qualcomm) developer‑tooling va optimallashtirishlar orqali real‑vaqt inferensni yaxshilashga qaratilgan yechimlar taqdim etadi.

Qachon mahalliy AI ayniqsa foydali?

  • Maxfiy hujjatlar yoki shaxsiy ma’lumotlarni internetga yubormasdan qayta ishlash kerak bo‘lganda.
  • Internet aloqasi yo‘q joylarda tezkor tarjima, qisqa summarizatsiya yoki yozma yordam talab etilganda.

Ammo katta hajmli fayllar yoki uzluksiz chat‑seanslar uchun saqlash, RAM va batareya cheklovlari sababli bulut yoki gibrid yechimni ko‘rib chiqish maqbul bo‘ladi.

Yakun

Mahalliy generativ AI bugungi kunda amaliy va ko‘plab telefon va planshetlarda ishlashi mumkin — ammo bu qurilmaga, SoC va firmware‑ga bog‘liq. Google (Gemini Nano va MTP), Android AICore/ML Kit va Qualcomm kabi platformalar hamda jamoatchilik runtime’lari sizga mahalliy AIni sinash va ishlatishda yordam beradi. O‘zbekistonlik foydalanuvchilar uchun tavsiya: sotib olayotganda SoC, RAM va AI sozlamalarini tekshiring, ilovalar bilan qisqa test o‘tkazing va batareya/issiqlikni nazorat qiling.

Asosiy manba: Qualcomm Technologies Inc. — Snapdragon press material. Material mustaqil ravishda tekshirildi va o‘zbek tilida tayyorlandi.

Ko‘p so‘raladigan savollar

Qaysi telefonlar O‘zbekistonda on‑device LLMlarni ishga tushira oladi?

Aniq ro‘yxat yo‘q; umumiy qoida — zamonaviy yuqori yoki yuqori‑o‘rta sinf SoC (NPU bilan) va kamida 8 GB RAM bo‘lgan qurilmalar mahalliy LLMlarni yaxshi qo‘llab‑quvvatlaydi. Android AICore yoki OEM AI‑sozlamalari mavjudligini tekshiring.

On‑device AI batareya va telefon issiqligiga qanday ta’sir qiladi?

Mahalliy inferens uzluksiz CPU/NPU yukini oshiradi: qisqa 5–10 daqiqalik sinovda sezilarli batareya kamayishi va temperatura oshishi kuzatilishi mumkin. Uzoq sessiyalar uchun bulut yoki gibrid rejim ma’qul.

Qaysi ilovalar mahalliy/offline LLMlarni qo‘llab‑quvvatlaydi?

MLC Chat, PocketPal uslubidagi ilovalar va Ollama‑uslubidagi runtime’lar mahalliy model variantlarini qo‘llab‑quvvatlaydi. Ilova sozlamalarida "local" yoki "offline" rejimini qidiring va model yuklash hajmini tekshiring.

O‘zbek tilini mahalliy LLMlar qanday qo‘llab‑quvvatlaydi?

Bu model va uning trening ma’lumotlariga bog‘liq. Kichik offline modellarda ona tilida sifat chegaralangan bo‘lishi mumkin; ilova orqali modelni yuklashdan avval uning til qo‘llab‑quvvatlanishini tekshirish tavsiya etiladi.