Despre cantitate în limbă

4 februarie 2022 La fața timpului

În general vorbind, în limba engleză, cuvintele din fondul autohton, anglo-saxon, sînt monosilabice ori cel mult bisilabice, iar ce este mai lung de atît provine din culturi străine. Elementele latinești și grecești, în special, sînt printre cele mai lungi. Tendința englezilor de a prescurta, de a abrevia, de a face cuvintele să ocupe cît mai puțin timp în pronunție și spațiu în scriere a fost observată de multă vreme. În secolul al XVII-lea, Jonathan Swift tuna și fulgera împotriva numeroaselor lexeme monosilabice care, pierzîndu-și „demnitatea polisilabică”, deveniseră „rușinea limbii noastre”. În secolul următor, George Campbell critica omiterea, de către vorbitori, a tuturor silabelor cu excepția celei inițiale sau a primelor două: hypochondriac era acum hyp, reputation – rep, incognito – incog, extraordinary – extra, ultimate – ult, iar penultimate – penult. Nu a scăpat de oprobriu nici pronunția, la verbe, a terminației -ed, de trecut, care își pierdea vocala, lipind consoana finală de silaba anterioară și scurtînd astfel cuvîntul (pronunție care, de altfel, a devenit normă).

Dar ce importanță are, în limbă, aspectul unui cuvînt? După ce, în analiza lingvistică de pretutindeni, sensul a primat, timp de mii de ani, forma ocupă, la americani, un loc central începînd cu cel de-al Doilea Război Mondial, cînd noul context istoric și tehnologic cere imperios formalizarea limbii engleze (și ruse) în limbaje matematice, pentru construirea unor mașini automate de stenografiat și tradus; datele extrase prin excluderea sensului din descrierea lingvistică și concentrarea pe aspectele cantitative sînt necesare și pentru găsirea unor căi de a transmite mesaje (în context de război „cald” sau „rece”) rapid și fără pierdere de informație. De proprietățile statistice ale limbii engleze se ocupă însuși Claude Shannon, într-un studiu din 1948, prin care inginerul american fundamentează teoria informației (numită și „teorie a comunicației” sau „cibernetică”).

Ca orice alt fenomen, limba are proprietăți numerice, lucru care justifică aplicarea metodelor matematice, între care cea mai cunoscută e statistica. Cu ajutorul acesteia, spune Solomon Marcus, s-a pus în evidență „strînsa legătură care există în mod natural între vorbire și cibernetică. [...] în vorbirea curentă acționează diferite legi, care fac ca transmiterea informației prin limbaj să se facă în conformitate cu anumite principii de extrem”. Una dintre aceste legi, care poartă numele lui George Kingsley Zipf, profesorul de la Harvard care a formulat-o, privește frecvența cu care cuvintele apar într-un text: acest parametru (notat f) e invers proporțional cu rangul lexical (notat n). Rangul 1 revine cuvîntului care apare cel mai des, rangul 2 aparține celui a cărui frecvență vine imediat după acesta, și așa mai departe, astfel încît produsul dintre n și f(n) va fi o constantă (P).

Dicționarul Collins listează primele zece cele mai frecvente cuvinte din limba engleză: the, of, and, a, to, in, is, you, that, it. The va avea rangul n = 1, of are n = 2, ... it are n = 10. Conform legii lui Zipf, f(1) = P∕1, f(2) = P∕2, ... f (10) = P∕10. Sau the este de două ori mai frecvent decît of, de trei ori mai frecvent decît and și de zece ori mai frecvent decît it. S-a calculat, de exemplu, că articolul hotărît the apare în vorbire cu o frecvență de 7%, pe cînd prepoziția of cu circa 3,5%. Dacă ne uităm la lungimea acestor elemente (unitatea de măsură fiind silaba), observăm că toate sînt monosilabice, formate fiind din unul, două sau trei sunete. Astfel ajungem la altă lege lingvistică, privitoare la lungimea cuvintelor: cele mai scurte lexeme tind să fie și cele mai frecvente.

De exemplu, cercetările făcute pe un corpus de limbă română compus din Luceafărul lui Eminescu, poeziile lui Arghezi, Hanul Ancuței al lui Sadoveanu, un Îndreptar de punctuație și un Cod Civil converg spre aceeași concluzie: din numărul total de silabe din fiecare, frecvența cuvintelor monosilabice este cea mai mare. Concret, în Luceafărul, lexemele monosilabice reprezintă 58% din total, cele bisilabice 26,3%, cele trisilabice 11,9%, cele din patru silabe 3,4%, din cinci silabe 0,3%, cuvinte mai lungi de atît nefiind folosite deloc. Bineînțeles că, în orice domeniu, nu numai în lingvistică, acuratețea datelor statistice (pe baza cărora se formulează legi cu scopul de a prezice comportamentul) depinde de numărul de elemente luate în calcul: cu cît ele vor fi mai numeroase, cu atît rezultatul va fi mai exact, și invers. Pentru totalitatea vocabularului românesc s-a stabilit că frecvența cea mai mare o au cuvintele monosilabice (39,37%), urmate de cele bisilabice (24,11%).

Zipf explică circulația mare a cuvintelor scurte prin presiunea pusă de o comunicare eficientă: concizia maximă în transmiterea informației poate fi obținută prin folosirea celor mai frecvente sensuri, codificate în cele mai scurte cuvinte. Solomon Marcus pare să sugereze același lucru cînd spune că, „deoarece în limbajul curent este necesar ca informațiile să se transmită cît mai rapid, în mod spontan fondul de bază este format în special din cuvinte scurte”. Zipf dă un nume acestei legi fundamentale care „guvernează orice tip de comportament individual și colectiv, inclusiv comportamentul lingvistic”: „principiul minimului efort”, prin care are în vedere efortul fizic de articulare, de pronunțare. Însă cercetări de ultim deceniu făcute la Massachusetts Institute of Technology arată că un alt factor s-ar corela, mai bine decît frecvența, cu lungimea unui cuvînt – anume, cantitatea de informație conținută.

Într-un studiu din 2011, cercetătorii de la MIT (Steven Piantadosi, Harry Tily și Edward Gibson) spun că teoria lor diferă de cea a lui Zipf în două moduri cruciale. În primul rînd, un vocabular în care lungimea elementelor depinde de informația conținută „nu ar fi cel mai concis posibil, pentru că lexemele foarte informative nu ar fi scurtate, chiar dacă ar exista și cuvinte distinctive mai scurte”. În al doilea rînd, „ar ține cantitatea de informații transmise în comunicare la o valoare cît mai constantă posibil”, astfel încît să nu fie depășite nici posibilitățile aparatului fonator și nici cele ale creierului. Daniel Everett vede în această teorie o puternică dovadă a faptului că, în limbă, la fel ca în orice altceva, „forma urmează funcția”. Lingvistul american invocă părerea unui arhitect american faimos, Louis Sullivan, care spune: „În toate lucrurile organice și anorganice, în toate lucrurile fizice și metafizice, în toate lucrurile umane și supraumane, în toate manifestările minții, ale inimii și ale sufletului, în toate vedem aceeași lege fundamentală: viața se recunoaște în expresia ei, forma urmează funcției. Aceasta este legea”. Aplicat la limbă, acest principiu ar explica de ce, atunci cînd funcția principală a limbii este una utilitară, de transmitere de informație, scurtimea elementelor este esențială.

Datele din lingvistica statistică au fost extrapolate în alte domenii: recent a fost publicat un studiu în care autorii susțin că au identificat tipare similare sau chiar identice legilor din limbă în sistemele biologice, de la molecule (genom, gene, proteine) la organisme (comportamentul animal) și ecologie (populații și ecosisteme): de exemplu, legea frecvenței, a lui Zipf, ar fi aparentă în distribuția elementelor de floră și faună sau chiar în ratele de infecție COVID în rîndul populațiilor echivalente demografic, în funcție de mărimea teritoriilor ocupate; corelația lungimii cu frecvența s-ar vedea în ecologie, în faptul că, într-un spațiu dat, cele mai numeroase specii sînt și cele mai mici.

Întorcîndu-mă acum la obiecția lui Jonathan Swift, cu care am început textul de față: e de la sine înțeles că, într-o limbă, e nevoie de tot felul de elemente. O comunitate are, în sistemul lingvistic nativ, cuvintele care corespund cel mai bine nevoilor proprii, fie că sînt scurte sau lungi, ori au o sonoritate solemnă sau caraghioasă. Scopurile cu care e folosită limba depășesc cu mult elementara nevoie de transmitere de informație și se reflectă în bogăția lexicală distribuită pe paliere fixate de stiluri funcționale și registre de vorbire. Dar aceasta e o idee care va fi dezvoltată în articolul din numărul viitor, în care vom vedea cum atenția se mută de pe lungimea (sau scurtimea) cuvintelor pe sonoritatea acestora.

Laura Carmen Cuțitaru este conferențiar la Literele ieșene, specializată în lingvistică americană.

Foto: George Kingsley Zipf