Ar ais chuig an Bhlag
Blag

Do Mhúnla Teanga Féin a Thógáil: Beag Ach Cumhachtach

Aug 18, 2025·7 min read·Shranya Mahna
#AI development#custom AI models#efficient AI#lightweight LLMs#small language models
Do Mhúnla Teanga Féin a Thógáil: Beag Ach Cumhachtach

Cuid 4 de 5: Fiosrúchán Thú Féin a Chruthú

Fáilte ar ais! Tá RAG systems agus fíoráisiúchán a raibh ann ann cheana féin clúdaithe againn. Inniu, tá muid ag dul iomlán DIY — teanga-líonn a thógáil ó bhun. Anois, sula bhféadfá a shamhlú "is dócha go bhfuil sin róchasta dom," lig dom thú a thuiscint go soiléir. Ní bheidh an rud a thógáimid ionadaíoch ar GPT-5, ach beidh sé go hiomlán leatsa, ag rith ar do bhogearraí, agus do shonraí.

Cén fáth a dhéanfá Do Líonn Féin?

D'fhéadfá a rá, "Cén fáth a dhéanfá an roth arís nuair a bhíonn ChatGPT ann?" Seo an freagra:

Príobháideacht Iomlán: Ní fhágann do shonraí do ríomhaire. Gan glaoch API, gan spleáchais seachtrach.

Glas Null go Buan: Nuair a bhíonn sé traenáilte, tá sé saor a rith go deo.

Smacht Iomlán: Tugann tú faoi deara cad atá sé a fhoghlaim, conas a iompraíonn sé, agus cathain a fhágann sé nuashonrú.

Díriú Fearann: Is féidir le líonn beag traenáilte ar do chás úsáide ar leith níos fearr a dhéanamh ná líonna ollmhór do thascanna caolchúiseach.

Cad atá Muid a Thógáil

Taispeáinfidh mé duit conas a chruthú líonn teanga saincheaptha ag baint úsáide as PyTorch. Beidh ár sampla dírithe ar eolas cuideachta MyNextDeveloper, ach is féidir leat é seo a oiriúnú do aon réimse — doiciméid dlí, leabhair theicniúla, freagraí seirbhíse custaiméara, go deo.

Do Obair-Teach AI a Bhunú

Ar dtús, déanaimis ár n-uirlisí a réadú. Beidh Python agus roinnt leabharlanna de dhíth ort. Ná bíodh imní ort má nach bhfuil tú i do shaineolach códaithe — míneoidh mé gach rud céim ar céim.

import torch

import torch.nn as nn

import numpy as np

import matplotlib.pyplot as plt

from collections import Counter

import re

import math

Má bhíonn tú ag úsáid Google Colab (ar a bhraithim do thosaitheoirí), tá an chuid is mó de seo i gceist cheana.

Céim 1: An AI a Theagasc Focail a Thuiscint

Sula bhféadfaidh ár líonn teanga a fhoghlaim, caithfidh sé a thuiscint cad is focail ann. Tugtar tóchán ar an bpróiseas seo — téacs a bhrisceadh ina chuid is féidir leis an ríomhaire a oibriú leo.

class ImprovedTokenizer:

def __init__(self):

self.vocab = {}

self.inverse_vocab = {}
def build_vocab(self, text, min_freq=1): # Convert to lowercase and split into words and punctuation text = text.lower() words = re.findall(r'w+|[.!?,:;]', text) word_counts = Counter(words) # Create vocabulary with special tokens self.vocab = {'<PAD>': 0, '<UNK>': 1, '<START>': 2, '<END>': 3} for word, count in word_counts.items(): if count >= min_freq and word not in self.vocab: self.vocab[word] = len(self.vocab) self.inverse_vocab = {v: k for k, v in self.vocab.items()} print(f"Vocabulary size: {len(self.vocab)}")

Cad atá ag tarlú anseo? Tá muid ag cruthú foclóir ina bhfaigheann gach focal uathúil uimhir. Smaoinigh air go bhfuil muid ag tabhairt chárta aitheantais do gach focal i do réimse.

Céim 2: Do Shonraí Traenála a Réadú

Foghlaimíonn ár líonn trí thíortha d'focail agus ag iarraidh a thuar cad a thagann ar aghaidh. Is cosúil le duine a theagasc teanga a thaispeáint dóibh milliúin d'fhothéacsanna abairt.

class ImprovedTextDataset:

def __init__(self, text, tokenizer, seq_length=32):

self.tokenizer = tokenizer

tokens = tokenizer.encode(text)

self.data = []
# Create input-output pairs for i in range(len(tokens) - seq_length): input_seq = tokens[i:i+seq_length] target_seq = tokens[i+1:i+seq_length+1] self.data.append((input_seq, target_seq))

Cruthaíonn sé seo na mílte sampla ina bhfaigheann an líonn tuairim focal agus foghlaimíonn sé cad ba chóir go dtiocfaidh ar aghaidh.

Céim 3: Inchinn Ár AI

Anois tagann an chuid dhraíochtúil — an líonra núis iarbhír a thógáil. Úsáidimid ailtire Transformer, an cineál céanna a chumhachtaíonn ChatGPT, ach níos beag.

class ImprovedTransformer(nn.Module):

def __init__(self, vocab_size, embed_dim=256, num_heads=8, num_layers=6):

super().__init__()

# Convert words to numbers the model can understand

self.token_embedding = nn.Embedding(vocab_size, embed_dim)
# Add position information so model knows word order self.pos_encoding = PositionalEncoding(embed_dim) # The transformer layers - where the magic happens encoder_layer = nn.TransformerEncoderLayer( d_model=embed_dim, nhead=num_heads, dim_feedforward=embed_dim * 4, dropout=0.1 ) self.transformer = nn.TransformerEncoder(encoder_layer, num_layers=num_layers) # Final layer to predict next words self.head = nn.Linear(embed_dim, vocab_size)

Foghlaimíonn an líonra seo patrúin in theanga trí sheichimh d'fhocail a phróiseáil trí roinnt sraith claochluithe matamaitice.

Céim 4: Líonn a Traenáil

Seo an áit ar a múinimid dó gach rud faoi do réimse:

def train(self, document_text, epochs=80, batch_size=4, learning_rate=0.0003):

# Prepare the data

dataset = self.prepare_data(document_text)

dataloader = DataLoader(dataset, batch_size=batch_size, shuffle=True)
# Create the model self.model = ImprovedTransformer(vocab_size=self.tokenizer.vocab_size) # Set up the learning process optimizer = optim.AdamW(self.model.parameters(), lr=learning_rate) criterion = nn.CrossEntropyLoss() # Training loop for epoch in range(epochs): total_loss = 0 for inputs, targets in dataloader: # Forward pass outputs = self.model(inputs) loss = criterion(outputs.view(-1, self.tokenizer.vocab_size), targets.view(-1)) # Backward pass optimizer.zero_grad() loss.backward() optimizer.step() total_loss += loss.item() if epoch % 10 == 0: print(f"Epoch {epoch}, Loss: {total_loss/len(dataloader):.4f}")

Is cosúil le an próiseas traenála a thaispeáint ar an líonn na mílte sampla agus a ligean dó go neamhdhíreach a bhealach a fhilleadh ar a bhreithiúnas.

Céim 5: Go Léir a Chur le Chéile

Déanaimis ár líonn ar eolas cuideachta MyNextDeveloper a traenáil:

# knowledge base

mnd_corpus = """

MyNextDeveloper (MND) is a remote-first tech company founded in 2022 in Mumbai.

They focus on supplying pre-vetted, highly skilled developers to startups.

Their mission is to solve the trust gap between startups and engineers by

emphasizing empathy, communication, and transparency.The company promotes agile practices, test-driven development, and

POSH-compliant culture. MND offers services like staff augmentation,

API and web development, UI/UX design, and AI/ML solutions.

"""

# Create and train the model

llm = ImprovedTopicLLM()

llm.train(mnd_corpus, epochs=80, batch_size=4, learning_rate=0.0003)

Céim 6: Do Chruthúchán a Thástáil

Nuair a bhíonn an traenáil críochnaithe, is féidir leat a bheith ag comhrá le do AI saincheaptha:

# Test different prompts

prompts = [

"What is MyNextDeveloper known for?",

"Where is MyNextDeveloper headquartered?",

"What technologies do they use?",

"How do they ensure trust?"

]
for prompt in prompts: response = llm.generate(prompt, max_length=30) print(f"Question: {prompt}") print(f"Answer: {response}")

Google Colab

Tá nasc Google Colab don alt seo anseo agus is féidir a rith i gcliceáil amháin: nasc

Ionchais a Bhainistiú

Bímis ionracaitheach faoin nrud atá tú a fháil. Beidh do líonn saincheaptha:

✅ Buntáistí:

  • Bídh sé go hiomlán príobháideach agus slán
  • Rith gan nasc an idirlín
  • Costais a dhéanamh tar éis traenála
  • Beidh sé oiriúnú do do réimse
  • Freagraí a ghiniúint gan a bheith ann

❌ Teorainneacha:

  • Ní bheidh eolas forleathan domhain ann
  • D'fhéadfadh freagraí a bheith ina n-athrá
  • Tá sonraí traenála den chéad scoth de dhíth
  • Tógann sé am agus iarracht a traenáil i gceart
  • Ní bheidh a bheith ar bhreiseán GPT-4

Feidhmchláir Saol Fíor

Seo roinnt úsáidí praiticiúla do mhúnlaí saincheaptha:

Seirbhís Custaiméara: Traenáil ar do FAQ agus tacaíochtaí páipéar don fhreagra tapa, seasmhach.

Doiciméadúchán Teicniúil: Cruthaigh líonn ina bhfuil sé ábalta a fhreagraí cheisteannaí faoi do bhogearraí sonrach nó próisis.

Giniúint Ábhar: Cur síos ar tháirgí, teimpléid ríomhphost, nó poist meáin shóisialaigh in do bhlas brand.

Dlíochtúil/Comhréir: Traenáil ar do rialacha tionscail do ghnáthamharcáil gealadh beag.

Leideanna Traenála ar Oibríonn Siad

1. Cáilíocht Thar Méid: 1,000 sampla scríofa i bhformáid is fearr ná 10,000 randamh.

2. Bheith Seasmhach: Má bhíonn do shonraí traenála neamhréireach, beidh do líonn neamhréireach.

3. Tosú Beag: Tosú le réimse dírithe seachas a bheith ag triail gach rud a chlúdach.

4. Tástáil Go Luath agus Go Rialta: Freagraí a ghiniúint i rith traenála chun fadhbanna a aimsiú go luath.

5. Do Líonna a Shábháil: Traenáilte líonna a shábháil go fírinneach ionas nár gá duit ó thosach a traenáil arís.

Eacnamaíc Múnlaí Saincheaptha

Déanaimis a rá faoi chostais:

Traenáil: Má bhíonn tú ag baint úsáide as GPUs scamall, bíodh súil agat ar $5–20 do líonn beag.

Rith: Go hiomlán saor a fhad is a traenáiltear.

Infheistíocht Ama: Tógann sé am a dhéanamh, ansin a chéile automatach

Cothabhála: Is féidir nuashonrú nuair a chéilíonn do bhunachar eolais

Déan comparáid sé seo go costais API: má tá tú ag déanamh na mílte iarratasuithe go fiosach, íocann líonn saincheaptha dó féin go tapa.

Cad Is Féidir a Ligint Amú?

Overfitting: Cuimhníonn an líonn ar do shonraí traenála ach ní féidir leis a dhéanamh generalize. Réiteach: Úsáid níos samplaí éagsúla agus traenáil níos giorra.

Underfitting: Ní fhoghlaim an líonn go leor. Réiteach: Traenáil níos faide nó úsáid níos sonraí.

Freagraí Athrá: Faigheann an líonn i greim in lúp. Réiteach: Déan tocht agus top-k paraiméadair a oiriúnú le linn giniúint.

Sonraí Mhaith Bhocht: Dramhaíl isteach, dramhaíl amach. Réiteach: Caith am glan agus d'théacs traenála a bhreisithe.

Scálú Suas

Nuair a bhíonn líonn oibritheach agat, d'fhéadfá ar iarraidh:

  • Traenáil líonna níos mó le níos paraiméadair
  • Comhcheangail múnlaí iolracha do réimsí éagsúla
  • Cuir teicnící giniúint níos sofisticiúla i bhfeidhm
  • Cuir comhéadan gréine simpli tógáil do dhream eile a úsáid

Ag Breathnú Ar Aghaidh

Thóg muid líonn teanga ó bhun — rud ar bhraithíomar ar bhealach ar bith ó bhraighdeanas ar bhealach roinnt blianta ó shin. San alt deireanach againn, taispeáinfidh mé duit conas do thúir AI a nasc leis an saol fíor ag baint úsáide as Model Context Protocol (MCP), ag iompraíonn siad ó chóras scartha ina gcumhachtaigh, chuardaitheoir cumhachtach.

Níl samhlacha teanga saincheaptha ach do thechgheallta mór anois. Le cur chuige ceart, tá aon fhiontair ábalta AI a chruthú a thuigeann a réimse i ndáiríre agus a labhraíonn a dteanga. D'fhéadfá nach GPT a bheith ann, ach is leatsa a bhí ann, agus uaireanta sin atá de dhíth go díreach.

Ag teacht suas: Alt 5 — "Do AI a Nasc leis an Domhan: MCP in Gníomh"