2011. április 9., szombat
Nem Pajek és nem is adatbázis
Helló, kedves Nyájas!
Ahogy látom, már kereken egy hónapja (!) hűtlen lettem hozzád. Mindazonáltal ez nem azt jelenti, hogy nem dolgoztam tovább a témánkon - a "linea-elv" (ld. korábbi bejegyzések) nagyjából működött. Közben átrágtam magam az adatbázis kezelési feladatokon (ld. utolsó bejegyzés) s most a gyakorisági alapadatok grafikus megjelenítésén dolgozom. Egész jól haladok, arzenálomba felvettem a JQuery-t, valamint egy jópofa, a feladatba vágó szoftvert is - s már csak egy lépésre vagyok egy fontos áttöréstől. Drukkolj nekem!
2011. március 10., csütörtök
Hihetetlen, de több mint egy hónapja nem jelentkeztem. Ok: a Pajek-vonalon eljutottam egy bizonyos szintig, s most visszakanyarodtam az adatbázis kérdéséhez. Végül sikerült egy WampServert telepíteni a gépemre, a hozzá tartozó PHP+MySQL-lel. Ez már önmagában is eredmény, de ezzel secc perc alatt sikerült a Strong fájlt kiterjesztett karakterekkel importálni (LOAD DATA INFILE). A nyerő lépés, ami most már működött is, a SET NAMES TO 'utf8' utasítás volt. Mitagadás, egész meghatódtam, amikor több mint 1 év (!) próbálkozás után a következőt qqcsolhattam (az első 10 Strong szám a hozzájuk tartozó lemmával):
2011. február 7., hétfő
Pajek 12
Nehéz a bányászok élete! Készítettem egy egyszerű blokkmodelt 1Kor13-ról az ún. disszimilaritási indexek alapján, melynek terméke egy dendrogram is. Működik is a dolog, csak éppen - de inkább qqcsold meg magad, kedves Nyájas:
A rejtény nyitja: a Pajek által erre használt export formátum (EncapsulatedPostScript) nem tudja "izomból" at UTF-8 karaktereket. Így kénytelen voltam a görög betűk ún. béta-kódját használni. Hát egyelőre - ez van a dendrogrammal. De ahogy mondani szokás: a remény hal meg utoljára!
..........................
Közben kapcsolatba léptem a Pajek fő fejlesztőivel (V. Bagatelj és A. Mrvar). Ők is elismerték, hogy ez valóban gond, s azt a kompromisszumot javasolták, hogy a címkék legyenek számok s az ezekhez tartozó UTF-8-as szavakat jelmagyarázatként szerkesszem bele egy grafikus editorral az ábrába. Íme az eredmény:

Hááááááát....
A rejtény nyitja: a Pajek által erre használt export formátum (EncapsulatedPostScript) nem tudja "izomból" at UTF-8 karaktereket. Így kénytelen voltam a görög betűk ún. béta-kódját használni. Hát egyelőre - ez van a dendrogrammal. De ahogy mondani szokás: a remény hal meg utoljára!
..........................
Közben kapcsolatba léptem a Pajek fő fejlesztőivel (V. Bagatelj és A. Mrvar). Ők is elismerték, hogy ez valóban gond, s azt a kompromisszumot javasolták, hogy a címkék legyenek számok s az ezekhez tartozó UTF-8-as szavakat jelmagyarázatként szerkesszem bele egy grafikus editorral az ábrába. Íme az eredmény:

Hááááááát....
2011. február 4., péntek
Pajek 11
Hát ez nem volt semmi! Phm két megfelelő vektorát akartam közzétenni, de a kis huncutok 2 sorral kilógnak az ablakból. Így két darabban kell Alt+PrtScr-nnel bebűvölni egy grafikus szerkesztőbe. Nosza, találtam egy aranyos free képlopót, PickPick a neve, ami tudja a scrollozható ablakok mentését is. Tudja - csak éppen ezt nem. Valószínű az lehet, hogy a Pajek editora csak child window (s ezért, ha becsukod a main window-t, bezárul ez is). Maradt tehát egyelőre a fáradságos szerkesztgetés. Ez probléma lehet a későbbiekben is, ha nagyobb hálózat kerül elő. Hát így becsüld, kedves Nyájas, a következő két képet!
Phm pontjainak közelségi indexei:
2011. február 3., csütörtök
2011. január 30., vasárnap
Pajek 9
Tegnap írtam, hogy a köztesség (betweenness) még cselesebb mutató, mint a közelség (closeness). Ha megnézted a két táblázatot, bizonyára észrevetted, hogy előbbinek van egy feltűnő tulajdonsága. Még szembetűnőbb és egyértelműbb a dolog, ha a köztességi adatvektor alapján rajzoljuk meg a hálózatot. Íme:
2011. január 29., szombat
Pajek 8
Hi! Ma az volt a linea, s ezzel ment el az időm, hogy rájöttem: a Pajekben az Options menüpontban elrejtve mégis csak meg lehet adni, hogy mentse le a pontok koordinátáit. Megérte az idő, hiszen ezentúl gyorsan tudom visszatölteni a régebbi ábrákat.
Így viszont ma már sajna csak kevés időm maradt, úgyhogy csak röviden! A tegnapi bejegyzésben elmagyaráztam a (normált) fokszámot, mint ami egy pont centralitásának legegyszerűbb mutatója. Van azonban két további index erre, egy rafinált és egy még rafináltabb - nem túl rég találták ki őket, az egyik a közelség (closeness), a másik a köztesség (betweenness). Az utóbbit én magyarítottam meg így; ha nagy leszek, becsszó utánanézek, hogy hivatalosan hogy hívják magyarul. A lényeg azonban, hogy mit is takar a két fogalom, ehhez viszont ismerni kell a pontok közti távolság fogalmát. Ez annyira intuitív, hogy az óvodás is jó eséllyel megérti. Csak egy dolog a fontos: a távolság - a geometriai analógiának megfelelően - mindig 2 pont közötti legrövidebb utat jelent, ugyanis egy hálózatban többnyire többféleképpen is el lehet jutni A pontból B-be. Jó analógia a közlekedés, de az emberek ismeretségi hálózata is. (V.ö. Facebook!) Ennek akkora szakirodalma van, hogy - keress rá, dear Nyájas a neten! Érdekes módon szociológusok voltak azok, akik már jóval az Internet elterjedése előtt rámutattak arra, hogy ebben az utóbbi hálózatban a távolságokat általában - durván túlbecsüljük! Kagylózz, Nyájas, kvizkérdés jő: hány lépésre vagyok én, WR, a közvetlen ismeretségek hálózatában - Barack Obamától, akivel ugyebár nagy valószínűséggel soha nem fogok találkozni? A válasz most kapaszkodj meg: minössze 4, azaz négy lépés. Íme: 1: Lackner Pál - 2: Erdő Péter 3: XVI. Benedek - 4: Barack Obama!
Egy közismert példa a tudományokból az ún. Erdős-szám. Néhai matematikusunk, Erdős Pál, rendkívül termékeny volt, de ugyanakkor rendkívül nyitott is az együttműködésre, s így találták ki az Erdős-számot. Magyarázgatás helyett a definícióhoz egyszerűen idelökkentem a vonatkozó Wikipedia-linket. (Az érdekesség kedvéért: Einstein Erdős-száma 2.) Vetted az adást? Akkor jó! Akkor most már az alábbi ábrát is érteni fogod: a Rm - hálózat pontjain a számok ezúttal a pontok "Jézus-számait" jelentik. (NB: a '99' az egyszerűség kedvéért áll a végtelen-jel helyett: ez éppen az a 3 pont a hálózatban, amelyek más komponensben vannak, mint a kiindulópont, s így onnan értelemszerűen nem érhetők el.)

Egy közismert példa a tudományokból az ún. Erdős-szám. Néhai matematikusunk, Erdős Pál, rendkívül termékeny volt, de ugyanakkor rendkívül nyitott is az együttműködésre, s így találták ki az Erdős-számot. Magyarázgatás helyett a definícióhoz egyszerűen idelökkentem a vonatkozó Wikipedia-linket. (Az érdekesség kedvéért: Einstein Erdős-száma 2.) Vetted az adást? Akkor jó! Akkor most már az alábbi ábrát is érteni fogod: a Rm - hálózat pontjain a számok ezúttal a pontok "Jézus-számait" jelentik. (NB: a '99' az egyszerűség kedvéért áll a végtelen-jel helyett: ez éppen az a 3 pont a hálózatban, amelyek más komponensben vannak, mint a kiindulópont, s így onnan értelemszerűen nem érhetők el.)

Miután a távolság fogalma immáron egyértelmű, jöhet a beígért két index, a közelség, ill. a köztesség. Mivel azonban sajna, az időm fogy, csak a tegnapihoz hasonló két táblázatot közlök Rm 1,1-17 hálózatának pontjaira. Study it, please!
Rm 1,1-17 - a pontok köztességi (betweenness) indexe
Rm 1,1-17 - a pontok közelségi (closeness) indexe
Rm 1,1-17 - a pontok köztességi (betweenness) indexe
2011. január 28., péntek
Pajek 7
Hi, Nyájas! Úgy látom, egy-kétszer elmaradt a napi linea, de ma nem! Azzal folytatom, amivel akár kezdhettem is volna. A hálózatokat nemcsak rajzolni lehet; létezik rájuk nagyon sok számszerű index(mutató) is, amik közül nem egy már a szociometriában is használatos volt. Ezek egy része a teljes hálózatot jellemzi, mások meg külön-külön az egyes csomópontokat. Logikusabb lenne az előbbiekkel kezdeni, azért én természetesen - az utóbbiakkal kezdem.
Bocs, Nyájas, de most közben magamat kell figyelmeztetnem. A Pajek (szlovén: pók) kétségkívül zseniális szoftver, de hogy nem éppen user-friendly, azt már többen is joggal szóvá tették. Jelen esetben, a fokszámok kalkulációjánál, nagyon figyelnem kell, hogy a hálózat-partíció-vektor rendezettsége szinkronban legyen, különben a számok nem stimmelnek össze a címkékkel s így hülyeséget kapunk.
A mutatók közül több is a centralitás fogalmát jellemzi. Egy csomópont centralitásának legegyszerűbb mutatója a már említett fokszám, amit itt a különböző hálózatok összehasonlítása céljából normalizálva, tehát az adott hálózatban elvileg lehetséges legmagasabb fokszámra vetítve adok meg. Rángassuk hát elő esmeg boldogtalan 3 textusunkat, s nézzük a csomópontok normalizált fokszámait! Íme, ez a helyzet Rm 1,1-17-re:
Bocs, Nyájas, de most közben magamat kell figyelmeztetnem. A Pajek (szlovén: pók) kétségkívül zseniális szoftver, de hogy nem éppen user-friendly, azt már többen is joggal szóvá tették. Jelen esetben, a fokszámok kalkulációjánál, nagyon figyelnem kell, hogy a hálózat-partíció-vektor rendezettsége szinkronban legyen, különben a számok nem stimmelnek össze a címkékkel s így hülyeséget kapunk.
Neked pedig, dear Nyájas, egy kis segítség a fenti táblázathoz. Ha ráklikkelsz, látod, hogy a "listavezető" theos (görög: Isten) szó indexe 0,6578947. Hogy jön ez ki? Nos, a hálózat 39 csomópontból áll, így egy pont lehetséges max. fokszáma 38. A theos abszolút fokszáma 25 (ld. az előző bejegyzések közt a fokszámos ábrát!), így a normált fokszám 25/38, ami a fenti értéket adja. Remélem, minden világos!?! Bizonyára igen, úgyhogy a mai bejegyzéshez már csak a másik két textus megfelelő táblázatát kell előállítanom (persze az előbbi bekezdés értelmében max. odafigyeléssel).
S most még itt alant hadd jöjjön Flm is!Íme, 1Kor13 megfelelő táblázata:
2011. január 23., vasárnap
Pajek 6



Remélem, a kis fejtörő tegnap nem okozott gondot, kedves Nyájas s így jöhet az eddigi 3 textusra a beígért 3 "bi" hálózat.
Az értelmezéshez még egyszer: az egyes bi-componensek éleit különböző színek jelölik, a pontokon a számok pedig azt, hogy a pont hány bi-komponenshez tartozik. Ha ez a szám > 1, akkor ez a pont - bravó, kedves Nyájas, eltaláltad! - elvágó pont. A hidakat is könnyű megtalálni, hiszen ezek nem mások, mint 2 elemű bi-komponensek, s mint ilyeneknek, saját "különbejáratú" színük van. De most már tényleg figyuzd a fenti ábrákat (rendre: Flm, Rm1,1-17 és 1Kor 13) !
2011. január 22., szombat
Pajek 5
Nos hát akkor jöjjön a beígért új témakör, a bi-komponensek. Tkp. ezek két pofonegyszerű fogalom általánosításai, az egyik pontokra, a másik élekre vonatkozik. Az első az ún. elvágó (nemzetközi zsargonban: artikulációs) pont fogalma. A gráf egy pontját akkor hívjuk így, ha az a rá illeszkedő élekkel együtt törölve (NB: másként nem is lehet, hiszen csak a pontot törölve at érintett élek "lógva" maradnának!) a gráf komponenseinek (azaz összefüggő részgráfjainak) száma nagyobb lesz. A másik fogalom a híd. Egy élt ugyancsak akkor hívunk így, ha azt törölve a komponensek száma nő. Egy kis illusztráció azért most sem árt. Ehhez szolgál az általam eszkábált Móricka-ábra, amely a gráfok 3 fő alapstruktúráját szemlélteti.Most nézzük a 3 alapstruktúrát két új fogalmunk, az elvágó pont ill. a híd szempontjából! De ezt nem modom el részletesen, mert nem szeretnélek megsérteni, kedves Nyájas, úgyhogy lécci végezd el ezt a szellemi ujjgyakorlatot magad! Én addig előkészítem a folytatást!
2011. január 20., csütörtök
Pajek 4


"Nulla dies sine linea" - mondá állítólag az ókori római festő azaz nem teljék el egyetlen nap meghúzott vonal nélkül. Nos, a mai nagyon pici linea az, hogy grafikus szekesztő output régióját a defaultról egy kicsit, pontosan 1300-ról 1100-ra növelve csecse .PNG-t kapunk a hálózatokra.
Az ábrákról még egyszer: az első kettőn a pontok különböző színekkel jelölt osztályai (klaszterei) skatulyázottak, más szóval egymásba ágyazottak, mégpedig minél nagyobb a hozzá rendelt szám, annál belsőbb klaszterhez tartozik a pont. A legbelső osztályt tehát a legmagasabb indexű, azonos színű pontok jelzik. A harmadik ábrán a fokszámok a teljes gráfra vonatkoznak: ennyi szomszédja van az adott pontnak, ami - mint egy előző bejegyzésben már írtam - vizuálisan is könnyen ellenőrizhető.
Most egy újabb szakasz következik: a hálózatok egy újabb szempont szerinti elemzése, ezek pedig az ún. bi-komponensek. Nota bene egyszer s mindenkorra: nem kétirányú szexuális hajlammal bíró egyének összetevőiről van szó, hanem egy matematikailag precízen definiált gráfelméletei fogalomról. Addig is: adios, kedves Nyájas!
Az ábrákról még egyszer: az első kettőn a pontok különböző színekkel jelölt osztályai (klaszterei) skatulyázottak, más szóval egymásba ágyazottak, mégpedig minél nagyobb a hozzá rendelt szám, annál belsőbb klaszterhez tartozik a pont. A legbelső osztályt tehát a legmagasabb indexű, azonos színű pontok jelzik. A harmadik ábrán a fokszámok a teljes gráfra vonatkoznak: ennyi szomszédja van az adott pontnak, ami - mint egy előző bejegyzésben már írtam - vizuálisan is könnyen ellenőrizhető.
Most egy újabb szakasz következik: a hálózatok egy újabb szempont szerinti elemzése, ezek pedig az ún. bi-komponensek. Nota bene egyszer s mindenkorra: nem kétirányú szexuális hajlammal bíró egyének összetevőiről van szó, hanem egy matematikailag precízen definiált gráfelméletei fogalomról. Addig is: adios, kedves Nyájas!
2011. január 16., vasárnap
Pajek 3
A tegnapi 2. ábra Rm 1-nek a fokszámok alapján kalkulált belső magja volt. Mindazonáltal ezzel az algoritmussal (k-core, k-mag) nem kapunk mindig ilyen "szabályos" eredményt, ún. teljes gráfot. Íme a k-mag algó eredménye 1Kor 13 alapján:

Mielőtt megkeverednénk: a számok ezúttal azt jelentik, hogy a magon belül a pontok legalább ennyi másik ponttal vannak összekötve (k=5).
Na ezt később részletesebben. Most inkább azt, hogy a k-mag fogalmának mintegy duálisa az ún. "m-szelet" (m-slice). Tehát: ugyanaz az elv, csak pontok helyett élekre. Egy m-szeletet azok az élek és rájuk illeszkedő pontok alkotják, melyek súlya >= m. S a lényeg: úgy tűnik, hogy az ilyen kicsi és relative sűrű hálózatok esetében, mint a most vizsgáltak, a "szeletelés" többet mond, mint az előbb látott "magozás". Eddigi két példánkra így néz ki a dolog:

Mielőtt megkeverednénk: a számok ezúttal azt jelentik, hogy a magon belül a pontok legalább ennyi másik ponttal vannak összekötve (k=5).
Na ezt később részletesebben. Most inkább azt, hogy a k-mag fogalmának mintegy duálisa az ún. "m-szelet" (m-slice). Tehát: ugyanaz az elv, csak pontok helyett élekre. Egy m-szeletet azok az élek és rájuk illeszkedő pontok alkotják, melyek súlya >= m. S a lényeg: úgy tűnik, hogy az ilyen kicsi és relative sűrű hálózatok esetében, mint a most vizsgáltak, a "szeletelés" többet mond, mint az előbb látott "magozás". Eddigi két példánkra így néz ki a dolog:
2011. január 14., péntek
Pajek 2

Itt fent látható az egyik beígért következő minta, egy igazi locus classicusé: Rm 1,1-17. Ez már combosabb ábra, mi!?!
Na, hogy ne keseredj el, kedves Nyájas (alias dear reader), íme alant egy felettébb emészthető ábricsku, amely a fenti hálózat belső magját ábrázolja. Hogy ez hogy is jött ki, arról (Deo volente) legközelebb mesélek Neked!
Pajek1

Na nézzük csak, hogy néz ki!?!
Úgy látszik, nem is olyan rossz - főleg, ha rá lehet(ne) zoomolni!
Mit mondjak - rá lehet: klikkelj az ábrára és qqcs it please! NA MI EZ!??
MEGFEJTÉS: a szeretet himnusza (1Kor13) főneveinek (precízen: főnév-lemmáinak) hálózata. Két szó akkor és csak akkor van összekötve, ha legalább egy versben együtt fordulnak elő. A számok a pontok fokszámait jelentik, azaz hogy hány másikkal vannak összekötve (check it!); Azonos fokszámú pontok színe is azonos. Az összekötő vonalak vastagsága az együttes előfordulások számával arányos.
Jelenleg én is az ellenőrzés fázisában vagyok: mielőtt úgy istenigazában nekiesnék a munkának, összevetem ezt a hálózatot és további 3 minta-locusét az eredeti szöveggel. Addig be patient, dear reader!
Feliratkozás:
Bejegyzések (Atom)


















