Loading
Loading
Construirea unei capacități AI autentice pentru limba română — seturi de date, cadre de evaluare, modele ajustate fin și benchmark-uri dezvoltate în România, pentru vorbitorii de limba română.
Limba română este vorbită de aproximativ 24 de milioane de persoane, făcând-o una dintre limbile europene mai mari — și totuși este sever subreprezentată în AI. Majoritatea modelelor mari de limbaj sunt dezvoltate pentru engleză, alte limbi primind atenție secundară în cel mai bun caz. Când există suport pentru limba română, acesta este de obicei rezultatul includerii incidentale în corpusuri de antrenare multilingve, mai degrabă decât al ingineriei deliberate pentru caracteristicile specifice ale limbii române — morfologia sa bogată, sistemul de cazuri, diacriticele, variațiile regionale și provocările particulare ale procesării textului juridic, medical și administrativ românesc. NOVACORE AI este dedicată construirii unei capacități AI autentice în limba română. Aceasta înseamnă mai mult decât traducerea modelelor englezești sau includerea textului românesc în datele de antrenare. Înseamnă curatarea unor seturi de date românești de înaltă calitate, dezvoltarea unor cadre de evaluare care măsoară performanța reală în limba română (nu doar benchmark-uri englezești traduse), ajustarea fină a modelelor specific pentru sarcini în limba română și publicarea de dovezi despre ce funcționează — și ce nu — pentru această limbă specifică. Ca companie românească ce operează în Europa, aceasta este atât o prioritate comercială, cât și o chestiune de suveranitate digitală: vorbitorii de limba română merită sisteme AI care funcționează la fel de bine în limba lor ca și în engleză, iar instituțiile românești merită infrastructură AI care înțelege dreptul românesc, practica administrativă românească și contextul cultural românesc.
Curatarea unor seturi de date românești de înaltă calitate pe domenii — juridic, medical, administrativ, literar, jurnalistic și tehnic. Toate seturile de date sunt licențiate corespunzător, documentate cu metadate de proveniență și publicate cu termeni clari de utilizare. Construirea fundației de date care a lipsit AI-ului românesc.
Modele ajustate fin și cu pre-antrenare continuă optimizate pentru limba română. Modele care înțeleg morfologia românească, gestionează corect diacriticele, respectă registrele formale și informale și performează bine pe sarcini specifice românești — nu doar pe benchmark-uri englezești traduse.
Benchmark-uri de evaluare în limba română dezvoltate de vorbitori nativi — nu teste englezești traduse. Măsurarea gramaticii, utilizării diacriticelor, adecvării registrului, înțelegerii juridice și administrative și a înțelegerii contextului cultural. Publicate cu metodologie și rezultate.
Cercetare aplicată care demonstrează AI-ul românesc în contexte reale — procesarea documentelor guvernamentale, analiza textelor juridice, rezumarea dosarelor medicale, generarea de conținut educațional și automatizarea serviciilor cetățenești. Dovezi ale ceea ce AI-ul românesc poate livra cu adevărat.
Dezvoltarea și publicarea de resurse lingvistice pentru PLN românesc — corpusuri adnotate, treebank-uri de dependență, seturi de date pentru recunoașterea entităților numite, lexicoane de sentiment și analizoare morfologice. Construirea infrastructurii care permite altora să construiască AI românesc.
Parteneriate cu universități românești, institute de cercetare, agenții guvernamentale și instituții culturale. Dezvoltare comună de seturi de date, cadre de evaluare partajate și publicații de cercetare co-autorate. AI românesc construit cu instituții românești.
Evaluarea sistematică a cât de bine performează modelele actuale pe sarcini în limba română. Publicarea unor benchmark-uri oneste care arată unde se situează AI-ul românesc astăzi — și unde sunt cele mai mari lacune.
Asamblarea, licențierea, curățarea și documentarea textului românesc de înaltă calitate pe domenii. Publicarea seturilor de date cu proveniență clară, termeni de utilizare și metrici de calitate.
Ajustare fină specifică domeniului a modelelor consacrate pe date românești. Publicarea rețetelor de ajustare fină, a rezultatelor evaluării și a ponderilor modelelor.
Crearea unor cadre de evaluare cuprinzătoare proiectate de lingviști români și experți de domeniu. Benchmark-uri care măsoară ceea ce contează pentru română — nu doar teste englezești traduse.
Cercetare aplicată care demonstrează AI-ul românesc în contexte guvernamentale, de sănătate, juridice și educaționale. Implementări de referință cu dovezi de performanță publicate.
AI-ul care nu funcționează bine în limba română nu este neutru — dezavantajează vorbitorii de limba română, instituțiile românești și economia românească. Agențiile guvernamentale nu pot procesa eficient documentele cetățenilor. Furnizorii de sănătate nu pot rezuma cu acuratețe dosarele pacienților. Profesioniștii din domeniul juridic nu pot analiza în mod fiabil jurisprudența românească. Elevii nu pot învăța în limba lor maternă. Construirea unui AI autentic în limba română nu este o politețe culturală — este o necesitate economică și o chestiune de suveranitate digitală. NOVACORE AI este dedicată închiderii decalajului AI românesc cu cercetare bazată pe dovezi, resursată corespunzător — publicată deschis, dezvoltată colaborativ și implementată responsabil.
Secure AI and high-performance computing for enterprises, governments and research.