Tra il 28 e il 29 Settembre 2007 il noto search engine di Microsoft propone un profondo cambiamento del proprio algoritmo, abbandonando definitivamente il vecchio motore per un approccio basato in maniera decisa sul concetto di "pertinenza" e "rilevanza" dei risultati.
Il "fu" Msn
Facendo un passo indietro ricordiamo Msn in qualche modo come il " paradiso dei Seo ", il motore sul quale ottenere posizionamenti ai primissimi posti era sostanzialmente una questione di link popularity e keywords density. Una popolarità basata però solo sulla massa di link in entrata, senza troppi riguardi per la qualità e pertinenza delle pagine linkanti e soprattutto senza una vera scrematura nei confronti di siti web sovra ottimizzati o addirittura di veri e propri spam engine.
Un paradiso dunque anche per spammer a diversi livelli, spesso posizionati ai primissimi posti delle serp, rendendole sempre meno efficaci e pertinenti a danno dei visitatori.
Forse proprio questo handicap del vecchio sistema, e l'incredibile impegno dei concorrenti proprio sulla qualità dei risultati (in primo luogo di Google), spinge lo staff di Microsoft a lavorare su Live Search, a investire in modo deciso e definitivo su un nuovo motore: più veloce, in grado di ampliare la portata dei risultati, che elimini lo spam, che restituisca serp più pertinenti.
Parlarne ad un anno di distanza è fondamentale perché forse proprio ora si può comprendere pienamente la portata e gli effetti di questo cambiamento, operato attraverso diversi sforzi, tra i quali:
lo sviluppo e l'ampliamento di ricerche verticali;
il nuovo algoritmo in grado di generare serp pertinenti;
il miglioramento delle capacità di indicizzare pagine web.
Ricerche verticali, sulle orme della "ricerca universale" di Google.
Il nuovo Live Search investe innanzitutto nella direzione già intrapresa dal principale competitor Google (e in parte anche da Yahoo), fornendo all'utente possibilità di ricerca sempre più articolate e multimediali, definite ricerche verticali, ovvero che diano la possibilità di trovare immagini, mappe, video, notizie, ed altro, oltre ai tradizionali risultati testuali, come nel caso delle molteplici possibilità offerte dal motore di Mountain View (Google News, Google Images, Google Video, ecc.).
Questo approccio dà il segno della profonda "rivoluzione" attuata in casa Microsoft al fine di competere veramente nel futuro delle ricerche on line, intercettando e cavalcando le nuove frontiere già ampiamente sfruttate e apprezzate dagli utenti del web.
Serp più pulite e pertinenti
Quello che probabilente è tra i risultati più brillanti del "nuovo corso" è legato alla qualità delle serp, una qualità ottenuta, a detta della stessa Microsoft, tramite lo sfruttamento di alcuni fattori:
lavorando sul clickstream degli utenti (ovvero sulle informazioni relative ai percorsi seguiti on line dagli utenti, rilevate ad esempio tramite i cookies);
considerando fattori come la sintassi e l'associazione logica delle chiavi, per meglio interpretare e tematizzare le risposte alle ricerche degli utenti;
concentrandosi in generale sulla qualità dei contenuti delle pagine indicizzate, rilevando ed escludendo più efficacemente tecniche illecite di ottimizzazione e tentativi di spam.
Le serp generate dal nuovo Live Search sono valide, posizionano prima i contenuti rilevanti e pertinenti, bannando siti di spamming o che utilizzino trucchi contrari alle linee guida.
La link popularity conta ancora molto, ma è solo parte dell'algoritmo, non più il "lasciapassare" per le prime posizioni come nel passato, e sembra tenere conto non solo della massa ma anche della autorevolezza dei backlinks.
Un indice da 20 miliardi di pagine
"Un indice molto più grande! Stiamo cercando 20 Miliardi di pagine web. Quattro volte la dimensione del nostro indice precedente. Una cosa ancora, noi adesso abbiamo l'infrastruttura per aggiungerne facilmente ancora a miliardi (si, milardi) con relativa facilità. Questo garantisce che stiamo spingendo sulla nostra dotazione per accogliere la conoscenza umana nel nostro indice."
La frase di sopra, tradotta da un post del 2 Ottobre 2007 apparso sul Blog ufficiale dello staff di Live Search, annuncia, nel presentare le nuove caratteristiche del motore di ricerca, l'ampliamento della "dotazione", portando la capacità di indicizzazione del motore a superare le 20 miliardi di pagine.
In effetti nel corso dei mesi si è verificato una sorta di "azzeramento" delle pagine di moltissimi siti web precedentemente catalogate, con una nuova indicizzazione, ma non sempre più profonda rispetto a prima, anzi... Sui forum del Webmaster Center sono nei mesi fioccate lamentele per siti , completamente indicizzati in passato, improvvisamente spariti dagli indici o relegati ad un pugno di pagine (se non spesso alla sola homepage) in conseguenza della "reindicizzazione" di Live Search.
Inoltre sui nuovi siti pubblicati il motore di Microsoft non sembrerebbe ancora "splendere" in termini di velocità di inserimento.
Tra le motivazioni valide per spiegare il fenomeno, lo staff di Live Search raccomanda gli utenti un uso corretto di sitemaps, file robots.txt, o riconduce all'eventuale presenza di tecniche non consentite dal regolamento, sulle sezioni non prese in considerazione dall'indice del motore. Infine sottolinea che le pagine vengono indicizzate in base alla propria "rilevanza".
Tra i webmaster quella che invece spesso prevale è l'idea che si tratti di semplici ritardi legati forse proprio alla nuova massa del "super indice". Con i mesi infatti molti dei siti soggetti alla incompleta indicizzazione delle proprie pagine sono rientrati completamente (o quasi) alla situazione precedente.
Dal punto di vista dei publisher
Si è notata una serie graduale di innovazioni dirette agli addetti ai lavori, tra cui l'adeguamento del protocollo sitemap agli standard XML (identico oggi per Google, Yahoo e Live), la creazione del Live Search Webmaster Center , sito di supporto ricco di strumenti utili a gestire l'indicizzazione di uno o più siti web, la nascita del Forum e del Blog di supporto per informare ed aiutare utenti e titolari di siti web.
Concludendo questa piccola cronistoria dedicata a Live Search e alle sue evoluzioni nel corso dell'ultimo anno, è possibile fare una considerazione strettamente legata agli stessi publishers. Se prima il posizionamento su Msn poteva considerarsi "una passeggiata" , avvalendosi di qualche piccolo accorgimento e trucco, ad oggi il livello di difficoltà sulle chiavi è ormai paragonabile, se non in alcuni casi più elevato, a quello riscontrabile su Google e Yahoo.
Per questo, da quel "lontano" fine Settembre del 2007, lo sviluppo serio dell'algoritmo Live ha prodotto fluttuazioni negative degli accessi di molti siti contenenti codice ai limiti del consentito, siti che in qualche modo sono stati "riportati alla partenza", e che hanno dovuto e dovranno rifarsi strada nelle serp puntando su contenuti originali e di qualità, e su un corretto lavoro di ottimizzazione delle pagine.
: Roberto Federico
Il più vasto catalogo di prodotti informativi, Guide e manuali in formato ebook, libro, audiocorso e videocorso per la formazione e la crescita personale, professionale e finanziaria.
Visualizzazione post con etichetta Motori di ricerca. Mostra tutti i post
Visualizzazione post con etichetta Motori di ricerca. Mostra tutti i post
Il motore di ricerca che verrà
L'ultimo sussulto l'ha dato Cuil: appena messo online, in molti si sono chiesti se fossimo di fronte all'erede di Google. Già, l'erede: lo sforzo è di guardare avanti e di immaginare a chi spetterà l'onore di strappare la corona del numero uno a Big G. Ammesso naturalmente che il primato attuale sia destinato a terminare in tempi brevi.
Gli utenti determinano il numero uno
Possiamo però chiederci quali saranno o dovranno essere le caratteristiche del dopo Google.
Al tempo della nascita, Page e Brin avevano (vittoriosamente) puntato su una grafica minimalista e un algoritmo (più o meno) efficace. Tanto bastò a far passare Google da outsider a numero uno senza alcun investimento particolare in marketing promozionale.
Da qui isoliamo già un primo aspetto: i motori di ricerca costruiscono il loro successo su quello che dimostrano di saper fare. Campagne e pubblicità hanno un'efficacia piuttosto limitata: è la pratica e il passaparola degli utenti a determinare il successo.
E teniamo presente che ai tempi del debutto di Google blog e Web 2.0 non esistevano ancora: se nascesse oggi un motore di ricerca con lo stesso "carisma" ne sentiremmo parlare in tempi brevissimi. Come è successo con Cuil, salvo mostrarsi (almeno per ora) più una meteora che un pretendente.
La nuova frontiera: il Web 2.0
Un aspetto è sicuro: l'erede dovrà muoversi in modo brillante nel "nuovo" web. Elaborare ricerche "classiche" ma anche all'interno di blog, video, social network e le altre forme di User Generated Content. Il 2.0 insomma sarà il suo habitat di riferimento.
Non sarebbe male se dimostrasse la capacità di valutare l'autorevolezza dei contenuti e delle fonti, scremando al meglio in base alla qualità. Un compito certamente non facile che possiamo immaginare come un evoluzione molto più completa (e complessa) del Trustrank di Google.
E perché no, anche la possibilità di confrontare le diverse fonti all'interno di una panoramica ragionata.
Una nuova interfaccia?
Questa serie di esigenze possono tradursi anche in una nuovo modello di interfaccia.
La distribuzione grafica di Cuil rappresenta una possibilità d'impostazione: più colonne, maggiore utilizzazione dell'intera schermata, spazio minimo per una descrizione aggiuntiva. Un pò come l'home page di Chrome, con le sue miniature dei siti più visti dall'utente.
Stiamo parlando insomma di qualcosa di nuovo rispetto al mono colonna Google, che poi è lo stesso format di tutti i principali motori di ricerca. Siamo stati abituati ad una linearità interrotta solo da eventuali annunci pubblicitari, segnalazioni video o mappe geografiche: tremendamente usabile ma ormai, forse, un pò limitativa per la ricchezza multimediale della rete.
Certo, Big G permette ricerche precise per ambito: blog, video,... ma ora serve qualcosa di più sintetico e aggregante.
Aggregazione
E aggregazione è forse il termine forte per l'immaginazione, l'obiettivo macro da realizzare. In una rete sempre più densa di contenuti, il motore di ricerca si consolida come un punto di riferimento e di filtro per non smarrirsi.
Lo stanno già facendo i soliti Google (IGoogle) e Yahoo! ma anche qui c'è da lavorare e, forse, l'impostazione di Facebook può diventare un modello su cui ragionare.
Mi riferisco alla possibilità di incorporare applicazioni esterne in modo libero e, ancora più interessante, il fatto di poterle creare da zero.
In conclusione
Abbiamo troppe aspettative verso l'erede? È forse un pò troppo per un motore di ricerca? Io credo di no: i confini e le definizioni tendono a sfumare e per il futuro dobbiamo aspettarci qualcosa di sempre più ampio e allargato. In fondo per "spodestare" Google servirà uno strumento nuovo e particolarmente sorprendente: auguriamo buon lavoro e tanta fantasia ai pretendenti.
: Nicola Ferrari
Gli utenti determinano il numero uno
Possiamo però chiederci quali saranno o dovranno essere le caratteristiche del dopo Google.
Al tempo della nascita, Page e Brin avevano (vittoriosamente) puntato su una grafica minimalista e un algoritmo (più o meno) efficace. Tanto bastò a far passare Google da outsider a numero uno senza alcun investimento particolare in marketing promozionale.
Da qui isoliamo già un primo aspetto: i motori di ricerca costruiscono il loro successo su quello che dimostrano di saper fare. Campagne e pubblicità hanno un'efficacia piuttosto limitata: è la pratica e il passaparola degli utenti a determinare il successo.
E teniamo presente che ai tempi del debutto di Google blog e Web 2.0 non esistevano ancora: se nascesse oggi un motore di ricerca con lo stesso "carisma" ne sentiremmo parlare in tempi brevissimi. Come è successo con Cuil, salvo mostrarsi (almeno per ora) più una meteora che un pretendente.
La nuova frontiera: il Web 2.0
Un aspetto è sicuro: l'erede dovrà muoversi in modo brillante nel "nuovo" web. Elaborare ricerche "classiche" ma anche all'interno di blog, video, social network e le altre forme di User Generated Content. Il 2.0 insomma sarà il suo habitat di riferimento.
Non sarebbe male se dimostrasse la capacità di valutare l'autorevolezza dei contenuti e delle fonti, scremando al meglio in base alla qualità. Un compito certamente non facile che possiamo immaginare come un evoluzione molto più completa (e complessa) del Trustrank di Google.
E perché no, anche la possibilità di confrontare le diverse fonti all'interno di una panoramica ragionata.
Una nuova interfaccia?
Questa serie di esigenze possono tradursi anche in una nuovo modello di interfaccia.
La distribuzione grafica di Cuil rappresenta una possibilità d'impostazione: più colonne, maggiore utilizzazione dell'intera schermata, spazio minimo per una descrizione aggiuntiva. Un pò come l'home page di Chrome, con le sue miniature dei siti più visti dall'utente.
Stiamo parlando insomma di qualcosa di nuovo rispetto al mono colonna Google, che poi è lo stesso format di tutti i principali motori di ricerca. Siamo stati abituati ad una linearità interrotta solo da eventuali annunci pubblicitari, segnalazioni video o mappe geografiche: tremendamente usabile ma ormai, forse, un pò limitativa per la ricchezza multimediale della rete.
Certo, Big G permette ricerche precise per ambito: blog, video,... ma ora serve qualcosa di più sintetico e aggregante.
Aggregazione
E aggregazione è forse il termine forte per l'immaginazione, l'obiettivo macro da realizzare. In una rete sempre più densa di contenuti, il motore di ricerca si consolida come un punto di riferimento e di filtro per non smarrirsi.
Lo stanno già facendo i soliti Google (IGoogle) e Yahoo! ma anche qui c'è da lavorare e, forse, l'impostazione di Facebook può diventare un modello su cui ragionare.
Mi riferisco alla possibilità di incorporare applicazioni esterne in modo libero e, ancora più interessante, il fatto di poterle creare da zero.
In conclusione
Abbiamo troppe aspettative verso l'erede? È forse un pò troppo per un motore di ricerca? Io credo di no: i confini e le definizioni tendono a sfumare e per il futuro dobbiamo aspettarci qualcosa di sempre più ampio e allargato. In fondo per "spodestare" Google servirà uno strumento nuovo e particolarmente sorprendente: auguriamo buon lavoro e tanta fantasia ai pretendenti.
: Nicola Ferrari
Google e i link a pagamento
La campagna di Google contro i link testuali a pagamento: analizziamo quali sono gli aspetti emersi riguardo a questo tema controverso. Vendere link è contrario alle linee guida di Google? Come comportarsi per evitare perdita di ranking?
La cronaca degli eventi
Il 14 Aprile del 2007 sul blog di Matt Cutts (noto esponente del quality group di Mountain View) appare un post nel quale egli invita gli utenti a segnalare, tramite l'apposito modulo per lo spam report di Google, siti contenenti link a pagamento, inserendo la parola "paidlink" nel campo relativo al tipo di infrazione da denunciare.
In realtà, già dal 2005 nel suddetto blog si cominciava a discutere riguardo all'influenza negativa sui risultati delle ricerche indotta dal meccanismo dei link testuali a pagamento.
Ma con questo intervento di Aprile viene per la prima volta stabilita e resa esplicita una strategia ben precisa da parte di Google: tramite la raccolta delle informazioni dallo spam report sarà possibile modificare gli algoritmi del motore di ricerca con il fine di penalizzare siti web che contengano la fornitura, dietro compenso, di link utili a trasmettere (e quindi di fatto "vendere") PageRank.
Il 21 Agosto 2007 alla conferenza SES (Search Engine Strategies) di San Jose viene dedicata una sessione all'argomento con l'emblematico titolo "Are Paid Links Evil?". Il sottotitolo era "Search engines, especially Google, say don't do 'em. But some search marketers say paid links work. Are paid links subverting search quality? Or are they simply a fact of life, here to stay? We explore the issues, in this session."
Già in fase di presentazione della discussione appare dunque netta la presa di posizione nei confronti dei paid links, giudicati in grado di "sovvertire la qualità delle ricerche".
Durante questa sessione Matt Cutts sosterrà che i link a pagamento in grado di passare PR sono contrari alle linee guida di Google, etichettandoli come "spazzatura" e promettendo interventi da parte del motore di ricerca, sia in fase di elaborazione degli algoritmi sia con l'apporto dei quality rater "sguinzagliati" da Mountain View.
Più recentemente l'intervento di Cutts, postato sul notissimo Search Engine Journal il 29 Ottobre 2007, annuncia che l'ultimo aggiornamento del PageRank avrebbe colpito, con una penalizzazione in termini di valore assegnato, proprio i siti contenenti link a pagamento in grado di trasmettere PageRank. Di seguito un estratto:
"The partial update to visible PageRank that went out a few days ago was primarily regarding PageRank selling and the forward links of sites. So paid links that pass PageRank would affect our opinion of a site."
Opinioni e soluzioni
Inutile segnalare la quantità di commenti, critiche o vere e proprie accuse, mosse da alcuni protagonisti del settore, riguardo alle diverse esternazioni di Matt Cutts, e le richieste di spiegazioni più chiare sullo spirito e in particolare sulla la natura pratica di queste penalizzazioni promesse e/o attuate.
L'impatto di simili operazioni infatti non sarebbe indifferente soprattutto per gli operatori che negli anni, studiando gli sviluppi delle SERP, hanno creato significativi business legati ai Links Ads. E in questo senso sono considerabili logiche le proteste e le critiche, in quanto appare evidente l'entità del danno in caso di penalizzazioni o ban da parte di una delle prime fonti di traffico presenti nel web, appunto Google.
Negli ultimi anni infatti l'evoluzione degli algoritmi dei motori di ricerca ha gradualmente aumentato il peso degli link ricevuti dai siti web ai fini del posizionamento. Il meccanismo del PageRank di Google in particolar modo, una formula in grado di assegnare un valore ed esternarlo tramite la celeberrima "barretta verde", ha riscosso un successo netto, creando di fatto un "mercato" di link florido e, fino ad oggi, in continua espansione. Link in grado di aumentare la popolarità di un sito, il suo livello di PageRank, e in definitiva di determinarne un miglior posizionamento nelle SERP.
La compravendita di collegamenti ha in alcuni casi generato sopravvalutazioni di siti web, in grado di ottenere alti punteggi di PageRank indipendentemente dalla qualità e popolarità dei contenuti, servizi o prodotti offerti, ma piuttosto semplicemente acquistando link da altri siti più autorevoli (in termini di ranking).
Questi avvenimenti non hanno evidentemente garantito (agli occhi degli esperti di Google) il rispetto di criteri di qualità e veridicità nell'assegnazione del PR, in alcuni casi favorendo nelle SERP siti web disposti a comprare i propri link, a discapito di progetti validi spinti da un principio di concorrenza leale, fondato cioè su link in entrata generati spontaneamente.
Tra le critiche più diffuse sulla scelta di Google ci sarebbe l'accusa, rivolta al motore di ricerca, di una volontà discriminatoria (se non monopolistica) nei confronti delle sponsorizzazioni tramite link concorrenti rispetto ai programmi Adsense/Adwords.
Il tutto sarebbe quindi, secondo le contestazioni, deleterio per l'autonomia e l'autodeterminazione di un mercato sul quale molte sono le aspettative (e gli investimenti) di soggetti grandi e piccoli: la pubblicità on line.
A questo proposito in realtà è necessario chiarire un punto fondamentale della vicenda: di fatto Matt Cutts e Google non hanno in nessun modo posto sotto osservazione o penalizzazione la vendita di link in quanto tale, ma esclusivamente la presenza di link a pagamento in grado di "passare" PageRank.
Come è possibile leggere da una revisione del post di Matt Cutts, Google ritiene assolutamente consentito, senza incorrere in svalutazioni di nessun genere, inserire link sponsorizzati nelle proprie pagine, evitando però che essi influiscano sul ranking assegnato dai motori di ricerca.
A tale scopo è possibile ad esempio utilizzare l'apposito tag "nofollow" all'interno di ciascuno collegamento pubblicitario, come nel presente codice:
Questo tag è in grado di impedire allo spider del motore di seguire il link e di conseguenza permette di non influenzare il PR del sito collegato (e il posizionamento dello stesso nelle SERP).
Un'altra soluzione indicata da Matt Cutts è quella di inserire o indirizzare i link verso pagine interdette ai motori di ricerca tramite appositi comandi nel file robots.txt:
Per escludere una directory:
User-agent: *
Disallow: /directory da escludere/
Per escludere una pagina:
User-agent: *
Disallow: /pagina.htm
Per certi versi quindi la politica di Google nei confronti dei link a pagamento non apparirebbe dettata da fini monopolistici o repressivi, ma assolutamente coerente con le linee guida per i webmaster, e in linea con il perenne studio di algoritmi in grado di avvicinare sempre di più i risultati delle ricerche a criteri di attinenza e qualità. Ma nella comunità i dubbi sull'opportunità e le finalità di queste misure rimangono, e i comportamenti futuri del colosso californiano forse aiuteranno a fare maggiore chiarezza
: Roberto Federico
La cronaca degli eventi
Il 14 Aprile del 2007 sul blog di Matt Cutts (noto esponente del quality group di Mountain View) appare un post nel quale egli invita gli utenti a segnalare, tramite l'apposito modulo per lo spam report di Google, siti contenenti link a pagamento, inserendo la parola "paidlink" nel campo relativo al tipo di infrazione da denunciare.
In realtà, già dal 2005 nel suddetto blog si cominciava a discutere riguardo all'influenza negativa sui risultati delle ricerche indotta dal meccanismo dei link testuali a pagamento.
Ma con questo intervento di Aprile viene per la prima volta stabilita e resa esplicita una strategia ben precisa da parte di Google: tramite la raccolta delle informazioni dallo spam report sarà possibile modificare gli algoritmi del motore di ricerca con il fine di penalizzare siti web che contengano la fornitura, dietro compenso, di link utili a trasmettere (e quindi di fatto "vendere") PageRank.
Il 21 Agosto 2007 alla conferenza SES (Search Engine Strategies) di San Jose viene dedicata una sessione all'argomento con l'emblematico titolo "Are Paid Links Evil?". Il sottotitolo era "Search engines, especially Google, say don't do 'em. But some search marketers say paid links work. Are paid links subverting search quality? Or are they simply a fact of life, here to stay? We explore the issues, in this session."
Già in fase di presentazione della discussione appare dunque netta la presa di posizione nei confronti dei paid links, giudicati in grado di "sovvertire la qualità delle ricerche".
Durante questa sessione Matt Cutts sosterrà che i link a pagamento in grado di passare PR sono contrari alle linee guida di Google, etichettandoli come "spazzatura" e promettendo interventi da parte del motore di ricerca, sia in fase di elaborazione degli algoritmi sia con l'apporto dei quality rater "sguinzagliati" da Mountain View.
Più recentemente l'intervento di Cutts, postato sul notissimo Search Engine Journal il 29 Ottobre 2007, annuncia che l'ultimo aggiornamento del PageRank avrebbe colpito, con una penalizzazione in termini di valore assegnato, proprio i siti contenenti link a pagamento in grado di trasmettere PageRank. Di seguito un estratto:
"The partial update to visible PageRank that went out a few days ago was primarily regarding PageRank selling and the forward links of sites. So paid links that pass PageRank would affect our opinion of a site."
Opinioni e soluzioni
Inutile segnalare la quantità di commenti, critiche o vere e proprie accuse, mosse da alcuni protagonisti del settore, riguardo alle diverse esternazioni di Matt Cutts, e le richieste di spiegazioni più chiare sullo spirito e in particolare sulla la natura pratica di queste penalizzazioni promesse e/o attuate.
L'impatto di simili operazioni infatti non sarebbe indifferente soprattutto per gli operatori che negli anni, studiando gli sviluppi delle SERP, hanno creato significativi business legati ai Links Ads. E in questo senso sono considerabili logiche le proteste e le critiche, in quanto appare evidente l'entità del danno in caso di penalizzazioni o ban da parte di una delle prime fonti di traffico presenti nel web, appunto Google.
Negli ultimi anni infatti l'evoluzione degli algoritmi dei motori di ricerca ha gradualmente aumentato il peso degli link ricevuti dai siti web ai fini del posizionamento. Il meccanismo del PageRank di Google in particolar modo, una formula in grado di assegnare un valore ed esternarlo tramite la celeberrima "barretta verde", ha riscosso un successo netto, creando di fatto un "mercato" di link florido e, fino ad oggi, in continua espansione. Link in grado di aumentare la popolarità di un sito, il suo livello di PageRank, e in definitiva di determinarne un miglior posizionamento nelle SERP.
La compravendita di collegamenti ha in alcuni casi generato sopravvalutazioni di siti web, in grado di ottenere alti punteggi di PageRank indipendentemente dalla qualità e popolarità dei contenuti, servizi o prodotti offerti, ma piuttosto semplicemente acquistando link da altri siti più autorevoli (in termini di ranking).
Questi avvenimenti non hanno evidentemente garantito (agli occhi degli esperti di Google) il rispetto di criteri di qualità e veridicità nell'assegnazione del PR, in alcuni casi favorendo nelle SERP siti web disposti a comprare i propri link, a discapito di progetti validi spinti da un principio di concorrenza leale, fondato cioè su link in entrata generati spontaneamente.
Tra le critiche più diffuse sulla scelta di Google ci sarebbe l'accusa, rivolta al motore di ricerca, di una volontà discriminatoria (se non monopolistica) nei confronti delle sponsorizzazioni tramite link concorrenti rispetto ai programmi Adsense/Adwords.
Il tutto sarebbe quindi, secondo le contestazioni, deleterio per l'autonomia e l'autodeterminazione di un mercato sul quale molte sono le aspettative (e gli investimenti) di soggetti grandi e piccoli: la pubblicità on line.
A questo proposito in realtà è necessario chiarire un punto fondamentale della vicenda: di fatto Matt Cutts e Google non hanno in nessun modo posto sotto osservazione o penalizzazione la vendita di link in quanto tale, ma esclusivamente la presenza di link a pagamento in grado di "passare" PageRank.
Come è possibile leggere da una revisione del post di Matt Cutts, Google ritiene assolutamente consentito, senza incorrere in svalutazioni di nessun genere, inserire link sponsorizzati nelle proprie pagine, evitando però che essi influiscano sul ranking assegnato dai motori di ricerca.
A tale scopo è possibile ad esempio utilizzare l'apposito tag "nofollow" all'interno di ciascuno collegamento pubblicitario, come nel presente codice:
Questo tag è in grado di impedire allo spider del motore di seguire il link e di conseguenza permette di non influenzare il PR del sito collegato (e il posizionamento dello stesso nelle SERP).
Un'altra soluzione indicata da Matt Cutts è quella di inserire o indirizzare i link verso pagine interdette ai motori di ricerca tramite appositi comandi nel file robots.txt:
Per escludere una directory:
User-agent: *
Disallow: /directory da escludere/
Per escludere una pagina:
User-agent: *
Disallow: /pagina.htm
Per certi versi quindi la politica di Google nei confronti dei link a pagamento non apparirebbe dettata da fini monopolistici o repressivi, ma assolutamente coerente con le linee guida per i webmaster, e in linea con il perenne studio di algoritmi in grado di avvicinare sempre di più i risultati delle ricerche a criteri di attinenza e qualità. Ma nella comunità i dubbi sull'opportunità e le finalità di queste misure rimangono, e i comportamenti futuri del colosso californiano forse aiuteranno a fare maggiore chiarezza
: Roberto Federico
Quegli strani avvisi di Google
"Siamo spiacenti... ... ma non possiamo elaborare la tua richiesta in questo momento. Un virus o un'applicazione spyware ci sta inviando richieste automatiche e sembra che il tuo computer o la tua rete siano stati infettati."
Alcuni di voi potrebbero probabilmente supporlo. Tuttavia non ci troviamo di fronte ad un comune messaggio di un antivirus per computer, bensì ad un avviso di Google che, qualche volta, potrebbe apparire al posto di una ricerca. Non ci credete? Ecco una prova in italiano (riproducibile):
e l'originale versione in inglese.
Quindi Google si è messo a produrre un antivirus? Anche in questo caso la risposta è no. Più semplicemente, da un anno a questa parte Google ha iniziato a prendere evidenti precauzioni in termini di sicurezza su due fronti:
da un lato per l'utente, con l'intento di salvaguardare la sicurezza del navigatore fornendo avvisi per siti potenzialmente pericolosi. Su questo argomento consiglio di leggere l'articolo Google e Stopbadware;
dall'altro lato per la stessa Google. L'obiettivo del motore di ricerca è quello di cautelarsi il più possibile rispetto al fenomeno delle query automatiche, peraltro vietate dai termini d'uso di Google, generate al fine di ottimizzare risorse e prestazioni.
Ed è proprio il secondo punto ad aver richiesto, da parte di Google, l'implementazione di alcune misure di sicurezza preventive al fine di limitare l'uso indiscriminato dello scraping, una tecnica che si basa sulla richiesta ed analisi di una pagina web da cui viene 'scaricato' l'intero contenuto. L'obiettivo, inutile dirlo, è quello di eseguire query automatiche via Google, estrapolarne i risultati e gestire le informazioni attraverso tool o interfacce sostitutive a Google.
Quali sono le cause di questo messaggio?
Arriviamo dunque al succo del discorso: quali sono le cause che possono portare Google a mostrare questo messaggio?
Nonostante il contenuto del messaggio faccia riferimento alla possibile presenza di un virus o di qualche spyware sul vostro computer, non lasciatevi prendere dal panico.
L'ipotesi che realmente il vostro computer sia infetto è assolutamente remota, soprattutto nel caso in cui stiate leggendo questo articolo e le vostre competenze siano tali da far presupporre piuttosto l'uso di strumenti avanzati di monitoraggio per SEO.
Sono infatti questi software che, nella maggior parte dei casi, Google riesce ad individuare con una certa facilità. Tra i software più a rischio risultano:
Strumenti di analisi del posizionamento
Strumenti per l'analisi delle keyword
Strumenti per calcolare il page rank o ottenere informazioni su un sito in SERP
Tra questi programmi rientrano nomi noti, come ad esempio WebCEO o Keyword Analyzer. In passato, alcuni di questi strumenti sono anche stati bannati dagli indici di Google per violazione ripetuta delle TOS.
Attenzione, questo non significa che non dobbiate usare questi strumenti... solo siate scaltri nel configurarli in modo tale che il loro uso delle query automatiche non sia eccessivo in un breve lasso di tempo.
Disabilitazione totale o per query
Il messaggio di errore che avete visto nello screenshot non è il solo avviso che potreste incontrare. Esistono infatti due tipi di precauzione:
Limitazione delle ricerche per la singola query, ovvero la casistica identificata nello screenshot pubblicato in apertura. In questo caso Google tenta di prevenire un comportamento che sembra essere ricondubile ad un singolo worm/spyware/virus circoscritto a specifiche query.
Limitazione delle ricerche allargata che, come mostra lo screenshot seguente, si estende a qualsiasi query verso il motore di ricerca per un arco di tempo imprecisato. Questo è il caso "più problematico". Google ha individuato che dal computer (o dalla rete in caso di intranet) è stato inviato un numero eccessivo di query, normalmente riconducibile ad una infezione o all'uso di software. In questo caso, per ogni query successiva è richiesta la digitazione di un codice CAPTCHA che autentica la richiesta come se fosse proveniente da una persona.
Non tutte le query sono uguali
L'utilità o meno di questo sistema, così come la sua efficacia sono argomenti al di fuori dallo scopo di questo articolo.
La parte più interessante del sistema, a mio avviso, è verificare come lo stesso sia modellato anche in base ai reali pericoli della rete. Questo significa sostanzialmente che il "peso" attribuito ad ogni query da Google per determinare, in combinazione con il fattore frequenza, la corrispondenza ad una query anomala è diverso da query a query.
Potremmo dire che la probabilità che la query sia "maligna" è data dal superamento di una soglia di sicurezza, corrispondente in modo banale ad un valore. Così come avviene ad esempio per i filtri antispam nell'email, ogni query parte da un valore 0 al quale vengono sommati dei punti a seconda di determinati fattori. Il numero di query è anomalo? Somma +N punti. Il tipo di query è a rischio? Somma +N punti. Il tipo di query è molto a rischio? Somma +N*2 punti.
Questo significa, ad esempio, che se cercate rapidamente con la query Powered by PhpBB saltando tra pagine non consecutive, potrebbe capitarvi di visualizzare il messaggio più facilmente che se cercate il mio nome.
Il motivo alla base di questo sistema è tutto sommato semplice da capire. Alcuni worm hanno obiettivi specifici, come spiegato sul blog sicurezza di Google, ad esempio quello di identificare vulnerabilità su piattaforme tendenzialmente a rischio come PhpBB. In una scala di pericolosità, invece, una query per il mio nome suscita minore preoccupazione... e certo, sono mica Kevin Mitnick io!
Come prevenire il problema
Prevenire è meglio che curare. La prevenzione, in questo caso, consiste nel limitare l'uso di software che inviano richieste automatiche a Google. Una sana manutenzione al proprio computer, tuttavia, non guasta mai, giusto per essere sicuri che il vostro hard disk non assomigli ad un allevamento intensivo di virus.
: Simone Carletti
Alcuni di voi potrebbero probabilmente supporlo. Tuttavia non ci troviamo di fronte ad un comune messaggio di un antivirus per computer, bensì ad un avviso di Google che, qualche volta, potrebbe apparire al posto di una ricerca. Non ci credete? Ecco una prova in italiano (riproducibile):
e l'originale versione in inglese.
Quindi Google si è messo a produrre un antivirus? Anche in questo caso la risposta è no. Più semplicemente, da un anno a questa parte Google ha iniziato a prendere evidenti precauzioni in termini di sicurezza su due fronti:
da un lato per l'utente, con l'intento di salvaguardare la sicurezza del navigatore fornendo avvisi per siti potenzialmente pericolosi. Su questo argomento consiglio di leggere l'articolo Google e Stopbadware;
dall'altro lato per la stessa Google. L'obiettivo del motore di ricerca è quello di cautelarsi il più possibile rispetto al fenomeno delle query automatiche, peraltro vietate dai termini d'uso di Google, generate al fine di ottimizzare risorse e prestazioni.
Ed è proprio il secondo punto ad aver richiesto, da parte di Google, l'implementazione di alcune misure di sicurezza preventive al fine di limitare l'uso indiscriminato dello scraping, una tecnica che si basa sulla richiesta ed analisi di una pagina web da cui viene 'scaricato' l'intero contenuto. L'obiettivo, inutile dirlo, è quello di eseguire query automatiche via Google, estrapolarne i risultati e gestire le informazioni attraverso tool o interfacce sostitutive a Google.
Quali sono le cause di questo messaggio?
Arriviamo dunque al succo del discorso: quali sono le cause che possono portare Google a mostrare questo messaggio?
Nonostante il contenuto del messaggio faccia riferimento alla possibile presenza di un virus o di qualche spyware sul vostro computer, non lasciatevi prendere dal panico.
L'ipotesi che realmente il vostro computer sia infetto è assolutamente remota, soprattutto nel caso in cui stiate leggendo questo articolo e le vostre competenze siano tali da far presupporre piuttosto l'uso di strumenti avanzati di monitoraggio per SEO.
Sono infatti questi software che, nella maggior parte dei casi, Google riesce ad individuare con una certa facilità. Tra i software più a rischio risultano:
Strumenti di analisi del posizionamento
Strumenti per l'analisi delle keyword
Strumenti per calcolare il page rank o ottenere informazioni su un sito in SERP
Tra questi programmi rientrano nomi noti, come ad esempio WebCEO o Keyword Analyzer. In passato, alcuni di questi strumenti sono anche stati bannati dagli indici di Google per violazione ripetuta delle TOS.
Attenzione, questo non significa che non dobbiate usare questi strumenti... solo siate scaltri nel configurarli in modo tale che il loro uso delle query automatiche non sia eccessivo in un breve lasso di tempo.
Disabilitazione totale o per query
Il messaggio di errore che avete visto nello screenshot non è il solo avviso che potreste incontrare. Esistono infatti due tipi di precauzione:
Limitazione delle ricerche per la singola query, ovvero la casistica identificata nello screenshot pubblicato in apertura. In questo caso Google tenta di prevenire un comportamento che sembra essere ricondubile ad un singolo worm/spyware/virus circoscritto a specifiche query.
Limitazione delle ricerche allargata che, come mostra lo screenshot seguente, si estende a qualsiasi query verso il motore di ricerca per un arco di tempo imprecisato. Questo è il caso "più problematico". Google ha individuato che dal computer (o dalla rete in caso di intranet) è stato inviato un numero eccessivo di query, normalmente riconducibile ad una infezione o all'uso di software. In questo caso, per ogni query successiva è richiesta la digitazione di un codice CAPTCHA che autentica la richiesta come se fosse proveniente da una persona.
Non tutte le query sono uguali
L'utilità o meno di questo sistema, così come la sua efficacia sono argomenti al di fuori dallo scopo di questo articolo.
La parte più interessante del sistema, a mio avviso, è verificare come lo stesso sia modellato anche in base ai reali pericoli della rete. Questo significa sostanzialmente che il "peso" attribuito ad ogni query da Google per determinare, in combinazione con il fattore frequenza, la corrispondenza ad una query anomala è diverso da query a query.
Potremmo dire che la probabilità che la query sia "maligna" è data dal superamento di una soglia di sicurezza, corrispondente in modo banale ad un valore. Così come avviene ad esempio per i filtri antispam nell'email, ogni query parte da un valore 0 al quale vengono sommati dei punti a seconda di determinati fattori. Il numero di query è anomalo? Somma +N punti. Il tipo di query è a rischio? Somma +N punti. Il tipo di query è molto a rischio? Somma +N*2 punti.
Questo significa, ad esempio, che se cercate rapidamente con la query Powered by PhpBB saltando tra pagine non consecutive, potrebbe capitarvi di visualizzare il messaggio più facilmente che se cercate il mio nome.
Il motivo alla base di questo sistema è tutto sommato semplice da capire. Alcuni worm hanno obiettivi specifici, come spiegato sul blog sicurezza di Google, ad esempio quello di identificare vulnerabilità su piattaforme tendenzialmente a rischio come PhpBB. In una scala di pericolosità, invece, una query per il mio nome suscita minore preoccupazione... e certo, sono mica Kevin Mitnick io!
Come prevenire il problema
Prevenire è meglio che curare. La prevenzione, in questo caso, consiste nel limitare l'uso di software che inviano richieste automatiche a Google. Una sana manutenzione al proprio computer, tuttavia, non guasta mai, giusto per essere sicuri che il vostro hard disk non assomigli ad un allevamento intensivo di virus.
: Simone Carletti
Cosa gli spider dei motori di ricerca non sanno fare
Search Engine Strategies, forum SEO e blog sul posizionamento: non c'è un'occasione dove non si senta parlare, o non si legga, delle caratteristiche dei motori di ricerca, delle regole da seguire per una corretta indicizzazione e dei suggerimenti da tenere in considerazione.
Sebbene questi elementi siano in realtà la sostanza di un corretto posizionamento, è bene considerare che si tratta del risultato dell'interpretazione delle capacità dei crawler dei motori di ricerca. Mi spiego meglio.
Si sente spesso che è importante limitare il numero di parametri in querystring al fine di garantire la corretta indicizzazione della pagina web. Perchè? La risposta è tutto sommato semplice e deriva da alcune limitazioni dei crawler meno evoluti che potrebbero incappare in loop o duplicazioni automatiche a causa di eccessivi parametri o una configurazione errata del sito web. Risultato? Le pagine non verranno indicizzate.
Insomma, praticamente ogni buona regola per una corretta indicizzazione deriva da quello che i crawler dei motori di ricerca sanno e non sanno fare. Giusto! Ma allora, cosa non sanno fare i motori di ricerca, oggi? Andiamo a scoprire alcune limitazioni, desiderate o indesiderate, dei crawler. Conoscerle ci aiuterà a progettare meglio un sito web ed agevolare l'indicizzazione.
Gestire i Cookie
I motori di ricerca non sanno gestire i cookie o, più semplicemente, gestirli potrebbe non risultare così interessante agli occhi dei motori di ricerca.
Ogni qual volta che il crawler accede ad una pagina del vostro sito ogni cookie inviato scade nell'esatto momento in cui termina la richiesta del crawler, indipendentemente che si tratti di un cookie di sessione o di un cookie datato. Ogni successiva richiesta del crawler non conterrà traccia dei cookie precedentemente inviati e quindi sono sarà possibile risalire a proprietà precedentemente impostate.
In pratica, i crawler non potranno quindi portare avanti un processo di acquisto in un e-commerse se il carrello è gestito via cookie (beh, dubito comunque che sia di vostro interesse un acquisto da GoogleBot), così come non potranno seguire percorsi di navigazione alternativi basati sull'ultima connessione dell'utente, ovviamente se salvata nei cookie.
In sintesi
Data questa limitazione è bene non affidare ai cookie dati che possano limitare la navigazione del sito. Ad esempio, implementare un controllo sulla capacità di gestire i cookie ed inviare il client ad una pagina di errore se il controllo fallisce non è certo una soluzione utile. Qualsiasi crawler di un motore di ricerca finirà sempre, inesorabilmente, nella pagina di errore ed il vostro fantastico sito da 10.000.000 di pagine non verrà neanche visto di striscio!
Gestire le Sessioni
L'argomento sessioni è tutt'altro che banale. Prima di procedere è bene chiarire brevemente il valore delle sessioni ed il loro funzionamento.
Il funzionamento della sessione
Poiché il protocollo HTTP è senza stato, ovvero non conserva alcuna informazione tra una richiesta e l'altra, per poter garantire interazioni avanzate tra utenti e siti web, come una transazione di commercio elettronico, è stato neceessario introdurre il concetto di sessione. Ogni qual volta vi connettete ad un sito web, il web server che lo gestisce genera un identificativo univoco chiamato ID di sessione che vi rappresenterà per un limitato periodo di tempo. In questo modo, sarà possibile associare alla vostra sessione una serie di dati caratterizzanti, come ad esempio il vostro nome utente se siete autenticati nel sito, oppure la lingua preferita per permettervi di navigare agevolmente su un sito tradotto in più versioni.
Ora arriviamo al punto cruciale: nella maggior parte dei casi, anzi praticamente sempre, i crawler non sanno gestire le sessioni. Il motivo è sostanzialmente una conseguenza dell'incapacità di usare i cookie e della natura multi-threading dei crawler. Vediamo insieme cosa significa.
L'ID di sessione, generato dal server, deve essere salvato dal client in qualche modo. Il modo predefinito è un cookie, un semplice cookie che contiene l'ID univoco e scade al termine della sessione stessa, in genere 20 minuti. Poiché abbiamo appena visto che i crawler non sanno gestire i cookie, la sessione non può essere salvata e di conseguenza i crawler non sanno gestire le sessioni.
Esiste un'alternativa. Nel caso in cui il web server si accorga che il client non è in grado di gestire i cookie, può essere configurato in modo da appendere l'identificativo di sessione ad ogni URL richiamata nel sito. Ecco alcuni esempi di session ID generata in Java:
http://www.sito.com/pagina.jsp;jsessionid=7E8C3C2594D3CFB297CF75218E3537B5.acaps1
Ed ecco un esempio per PHP:
http://www.sito.com/pagina.php?PHPSESSID=062b4f2d4dcb85d7dd56f09c3e809f9f
Problema risolto? Al contrario! Passare la Session ID via querystring è uno degli errori più grandi che possono penalizzare un sito web nella fase di indicizzazione. Vediamo perché.
Passare l'ID di sessione in querystring è pericoloso!
La SessionID è univoca per ogni sessione utente, giusto? Quindi se io mi connetto 5 volte in 5 giorni avrò 5 session ID differenti. Se un crawler si connette 10 volte a questo indirizzo
http://www.sito.com/pagina.php
gli verranno assegnate 10 session ID differenti, a meno di non conservarne una arrivando da un link con una session ID in querystring. Andiamo avanti nel ragionamento.
I crawler supportano il multi threading. Ovvero, potreste trovarvi sul vostro sito un singolo crawler così come 15 crawler contemporaneamente che analizzano 15 aree differenti.
Ora è il momento dei conti. Se io ho 15 istanze di GoogleBot contemporaneamente sul mio sito, ognuna delle quali genera una media di 10 sessioni id differenti ipotizzando che non arrivi da una pagina con id di sessione, avrò che il web server genererà ben 150 id di sessione differenti solo per Google e solo in pochi minuti.
Ma a questo punto, ecco che la mia pagina
http://www.sito.com/pagina.php
se io passo in querystring il valore della sessione potrebbe trasformarsi in
http://www.sito.com/pagina.php?PHPSESSID=835564f65c7df92e0d2eb667168c82f9
http://www.sito.com/pagina.php?PHPSESSID=062b4f2d4dcb85d7dd56f09c3e809f9f
http://www.sito.com/pagina.php?PHPSESSID=91a78f9969da61bd991a78f9969da61d
http://www.sito.com/pagina.php?PHPSESSID=3ef1d9428cf275202016b31c23545ffa
http://www.sito.com/pagina.php?PHPSESSID=2015ca2f2b2235e6090c9007aa281f62
ed altre 145 versioni differenti! Una pagina per 145 (ed oltre) indirizzi: è un attimo che un crawler non evoluto identifichi (erroneamente) il sito come contenuti duplicati ed escluda le pagine dal processo di indicizzazione.
Potrei portarvi almeno una decina di esempi che vi dimostrano quest'affermazione ma trattandosi di clienti ho qualche limitazione. Ad ogni modo fate una prova. Scegliete dei siti che passano la session id in querystring e dei quali conoscete precisamente il numero di pagine da cui sono composti. Eseguite una ricerca in Google per identificare il numero di pagine indicizzate e confrontatelo con il numero di pagine totali. Quasi sicuramente sarà minore!
In Sintesi
Nella quasi totalità dei casi, per un motivo o per l'altro, i crawler non supportano le sessioni e dunque qualsiasi valore salvato in una sessione precedente viene perso È bene non affidare alle sessioni, così come ai cookie, elementi determinanti per la navigazione del sito.
Ad esempio, salvare la lingua scelta in una sessione e portare l'utente sempre sulla stessa pagina modellandola in base alle preferenze è un comportamento che può causare l'impossibilità del crawler di analizzare la pagina.
Interpretare JavaScript
Arriviamo alla fatidica domanda: i crawler leggono JavaScript?
Consapevole che generalizzare è difficile, ad ogni modo la risposta è SI. Avete letto bene, la risposta è sì soprattutto se si parla di crawler più evoluti come quello di Google. Attenzione bene però, ho scritto che i crawler leggono JavaScript ma questo non significa che lo interpretino e lo eseguano.
Sebbene questi 3 termini vengano usati troppo spesso come sinonimi, in realtà non lo sono per nulla. Chiariamo dunque una volta per tutte la questione, ripeto, consapevoli che ogni crawer ha nel suo piccolo caratteristiche differenti.
I crawler leggono JavaScript
I crawler, in particolare quelli più evoluti come Google, leggono JavaScript molto spesso appositamente. Sono in grado di leggere i file JavaScript e seguire le relazioni esterne indicate nel tag
dato che, per quanto funzionali e comodi a dirottare rapidamente l'utente verso una pagina completa (ad esempio l'home page), di fatto rappresentano una causa molto probabile di penalizzazione o ban da parte dei motori di ricerca, in quanto da essi considerati spam.
5) se abbiamo previsto contenuti sostitutivi, proponendo ai motori di ricerca di "ignorare" le pagine contenute nei frame, con l'uso di attributi nofollow sui link diretti a tali pagine, congiuntamente all'esclusione delle cartelle o dei singoli documenti nel file robots.txt.
In conclusione quindi, qualora l'uso dei frame sia indispensabile, sarà necessario seguire i comportamenti precedentemente illustrati, mentre, nell'iniziare un nuovo progetto web, esso è vivamente sconsigliato, soprattutto se si desidera ottenere una buona risposta da parte dei motori di ricerca e mantenere un buon livello di usabilità per i visitatori.
: Roberto Federico
Sebbene questi elementi siano in realtà la sostanza di un corretto posizionamento, è bene considerare che si tratta del risultato dell'interpretazione delle capacità dei crawler dei motori di ricerca. Mi spiego meglio.
Si sente spesso che è importante limitare il numero di parametri in querystring al fine di garantire la corretta indicizzazione della pagina web. Perchè? La risposta è tutto sommato semplice e deriva da alcune limitazioni dei crawler meno evoluti che potrebbero incappare in loop o duplicazioni automatiche a causa di eccessivi parametri o una configurazione errata del sito web. Risultato? Le pagine non verranno indicizzate.
Insomma, praticamente ogni buona regola per una corretta indicizzazione deriva da quello che i crawler dei motori di ricerca sanno e non sanno fare. Giusto! Ma allora, cosa non sanno fare i motori di ricerca, oggi? Andiamo a scoprire alcune limitazioni, desiderate o indesiderate, dei crawler. Conoscerle ci aiuterà a progettare meglio un sito web ed agevolare l'indicizzazione.
Gestire i Cookie
I motori di ricerca non sanno gestire i cookie o, più semplicemente, gestirli potrebbe non risultare così interessante agli occhi dei motori di ricerca.
Ogni qual volta che il crawler accede ad una pagina del vostro sito ogni cookie inviato scade nell'esatto momento in cui termina la richiesta del crawler, indipendentemente che si tratti di un cookie di sessione o di un cookie datato. Ogni successiva richiesta del crawler non conterrà traccia dei cookie precedentemente inviati e quindi sono sarà possibile risalire a proprietà precedentemente impostate.
In pratica, i crawler non potranno quindi portare avanti un processo di acquisto in un e-commerse se il carrello è gestito via cookie (beh, dubito comunque che sia di vostro interesse un acquisto da GoogleBot), così come non potranno seguire percorsi di navigazione alternativi basati sull'ultima connessione dell'utente, ovviamente se salvata nei cookie.
In sintesi
Data questa limitazione è bene non affidare ai cookie dati che possano limitare la navigazione del sito. Ad esempio, implementare un controllo sulla capacità di gestire i cookie ed inviare il client ad una pagina di errore se il controllo fallisce non è certo una soluzione utile. Qualsiasi crawler di un motore di ricerca finirà sempre, inesorabilmente, nella pagina di errore ed il vostro fantastico sito da 10.000.000 di pagine non verrà neanche visto di striscio!
Gestire le Sessioni
L'argomento sessioni è tutt'altro che banale. Prima di procedere è bene chiarire brevemente il valore delle sessioni ed il loro funzionamento.
Il funzionamento della sessione
Poiché il protocollo HTTP è senza stato, ovvero non conserva alcuna informazione tra una richiesta e l'altra, per poter garantire interazioni avanzate tra utenti e siti web, come una transazione di commercio elettronico, è stato neceessario introdurre il concetto di sessione. Ogni qual volta vi connettete ad un sito web, il web server che lo gestisce genera un identificativo univoco chiamato ID di sessione che vi rappresenterà per un limitato periodo di tempo. In questo modo, sarà possibile associare alla vostra sessione una serie di dati caratterizzanti, come ad esempio il vostro nome utente se siete autenticati nel sito, oppure la lingua preferita per permettervi di navigare agevolmente su un sito tradotto in più versioni.
Ora arriviamo al punto cruciale: nella maggior parte dei casi, anzi praticamente sempre, i crawler non sanno gestire le sessioni. Il motivo è sostanzialmente una conseguenza dell'incapacità di usare i cookie e della natura multi-threading dei crawler. Vediamo insieme cosa significa.
L'ID di sessione, generato dal server, deve essere salvato dal client in qualche modo. Il modo predefinito è un cookie, un semplice cookie che contiene l'ID univoco e scade al termine della sessione stessa, in genere 20 minuti. Poiché abbiamo appena visto che i crawler non sanno gestire i cookie, la sessione non può essere salvata e di conseguenza i crawler non sanno gestire le sessioni.
Esiste un'alternativa. Nel caso in cui il web server si accorga che il client non è in grado di gestire i cookie, può essere configurato in modo da appendere l'identificativo di sessione ad ogni URL richiamata nel sito. Ecco alcuni esempi di session ID generata in Java:
http://www.sito.com/pagina.jsp;jsessionid=7E8C3C2594D3CFB297CF75218E3537B5.acaps1
Ed ecco un esempio per PHP:
http://www.sito.com/pagina.php?PHPSESSID=062b4f2d4dcb85d7dd56f09c3e809f9f
Problema risolto? Al contrario! Passare la Session ID via querystring è uno degli errori più grandi che possono penalizzare un sito web nella fase di indicizzazione. Vediamo perché.
Passare l'ID di sessione in querystring è pericoloso!
La SessionID è univoca per ogni sessione utente, giusto? Quindi se io mi connetto 5 volte in 5 giorni avrò 5 session ID differenti. Se un crawler si connette 10 volte a questo indirizzo
http://www.sito.com/pagina.php
gli verranno assegnate 10 session ID differenti, a meno di non conservarne una arrivando da un link con una session ID in querystring. Andiamo avanti nel ragionamento.
I crawler supportano il multi threading. Ovvero, potreste trovarvi sul vostro sito un singolo crawler così come 15 crawler contemporaneamente che analizzano 15 aree differenti.
Ora è il momento dei conti. Se io ho 15 istanze di GoogleBot contemporaneamente sul mio sito, ognuna delle quali genera una media di 10 sessioni id differenti ipotizzando che non arrivi da una pagina con id di sessione, avrò che il web server genererà ben 150 id di sessione differenti solo per Google e solo in pochi minuti.
Ma a questo punto, ecco che la mia pagina
http://www.sito.com/pagina.php
se io passo in querystring il valore della sessione potrebbe trasformarsi in
http://www.sito.com/pagina.php?PHPSESSID=835564f65c7df92e0d2eb667168c82f9
http://www.sito.com/pagina.php?PHPSESSID=062b4f2d4dcb85d7dd56f09c3e809f9f
http://www.sito.com/pagina.php?PHPSESSID=91a78f9969da61bd991a78f9969da61d
http://www.sito.com/pagina.php?PHPSESSID=3ef1d9428cf275202016b31c23545ffa
http://www.sito.com/pagina.php?PHPSESSID=2015ca2f2b2235e6090c9007aa281f62
ed altre 145 versioni differenti! Una pagina per 145 (ed oltre) indirizzi: è un attimo che un crawler non evoluto identifichi (erroneamente) il sito come contenuti duplicati ed escluda le pagine dal processo di indicizzazione.
Potrei portarvi almeno una decina di esempi che vi dimostrano quest'affermazione ma trattandosi di clienti ho qualche limitazione. Ad ogni modo fate una prova. Scegliete dei siti che passano la session id in querystring e dei quali conoscete precisamente il numero di pagine da cui sono composti. Eseguite una ricerca in Google per identificare il numero di pagine indicizzate e confrontatelo con il numero di pagine totali. Quasi sicuramente sarà minore!
In Sintesi
Nella quasi totalità dei casi, per un motivo o per l'altro, i crawler non supportano le sessioni e dunque qualsiasi valore salvato in una sessione precedente viene perso È bene non affidare alle sessioni, così come ai cookie, elementi determinanti per la navigazione del sito.
Ad esempio, salvare la lingua scelta in una sessione e portare l'utente sempre sulla stessa pagina modellandola in base alle preferenze è un comportamento che può causare l'impossibilità del crawler di analizzare la pagina.
Interpretare JavaScript
Arriviamo alla fatidica domanda: i crawler leggono JavaScript?
Consapevole che generalizzare è difficile, ad ogni modo la risposta è SI. Avete letto bene, la risposta è sì soprattutto se si parla di crawler più evoluti come quello di Google. Attenzione bene però, ho scritto che i crawler leggono JavaScript ma questo non significa che lo interpretino e lo eseguano.
Sebbene questi 3 termini vengano usati troppo spesso come sinonimi, in realtà non lo sono per nulla. Chiariamo dunque una volta per tutte la questione, ripeto, consapevoli che ogni crawer ha nel suo piccolo caratteristiche differenti.
I crawler leggono JavaScript
I crawler, in particolare quelli più evoluti come Google, leggono JavaScript molto spesso appositamente. Sono in grado di leggere i file JavaScript e seguire le relazioni esterne indicate nel tag
dato che, per quanto funzionali e comodi a dirottare rapidamente l'utente verso una pagina completa (ad esempio l'home page), di fatto rappresentano una causa molto probabile di penalizzazione o ban da parte dei motori di ricerca, in quanto da essi considerati spam.
5) se abbiamo previsto contenuti sostitutivi, proponendo ai motori di ricerca di "ignorare" le pagine contenute nei frame, con l'uso di attributi nofollow sui link diretti a tali pagine, congiuntamente all'esclusione delle cartelle o dei singoli documenti nel file robots.txt.
In conclusione quindi, qualora l'uso dei frame sia indispensabile, sarà necessario seguire i comportamenti precedentemente illustrati, mentre, nell'iniziare un nuovo progetto web, esso è vivamente sconsigliato, soprattutto se si desidera ottenere una buona risposta da parte dei motori di ricerca e mantenere un buon livello di usabilità per i visitatori.
: Roberto Federico
Google e StopBadware
This site may harm your computer o se preferite l'italiano Questo sito potrebbe arrecare danni al tuo computer.
Se qualcuno se lo stesse chiedendo, non sono impazzito e neppure sono stato ingaggiato per mettere in cattiva luce luce HTML.it. Quello che leggete ad inizio articolo è l'avviso, più o meno allarmante, che da qualche tempo compare a fianco di alcuni siti tra i risultati di Google, come lo screenshot seguente documenta (click sull'immagine per visualizzare lo screenshot completo):
Figura 1 - Screenshot di una SERP di Google con avviso
In questo articolo scopriremo meglio di cosa si tratta e, potendo parlare per esperienza vissuta, cercherò di fornirvi qualche indicazione utile per prevenire ma soprattutto "curare" questo problema.
A cosa fa riferimento questo avviso?
Dovete sapere che, a partire dall'inizio di febbraio 2007, Google ha attivato un servizio per segnalare agli utenti siti che potrebbero risultare potenzialmente pericolosi. Il servizio è attivo in collaborazione con il sito StopBadWare.org, un'organizzazione che si prefigge lo scopo di raccogliere e catalogare le segnalazioni di siti pericolosi.
Bene, direte voi a questo punto, ma cosa si intende per siti pericolosi?
Per siti pericolosi si intendono soprattutto quei siti che durante la navigazione potrebbero installare programmi dannosi al computer dell'utente, come spyware o dialer. Siti ricchi di popup con contenuti non esclusivamente sicuri, siti che riportano a loro volta un collegamento a siti definiti come a rischio.
Più marginalmente, questa lista include siti il cui obiettivo è phishing o frodi in termini di contenuti ed informazioni pubblicate.
Come anticipato in apertura, Google in collaborazione con StopBadWare ha attivato un servizio che, almeno inizialmente, dovrebbe proteggere l'ignaro utente dall'aprire siti pericolosi. Ma come funziona questo sistema? E soprattutto... funziona?
Il funzionamento del servizio di Google e StopBadWare.org
Procediamo con ordine, vedendo innanzitutto come si comporta questo servizio. Il motore dell'analisi è, contrariamente a quanti molti affermano, opera di StopBadWare.org. Questo sito si occupa di raccogliere e catalogare siti pericolosi. Le segnalazioni arrivano sia da Google, probabilmente grazie ad alcuni recenti aggiornamenti dell'algoritmo, sia dagli utenti stessi che possono inviare la loro segnalazione.
StopBadWare analizza singolarmente ogni report secondo le proprie linee guida e procede con la creazione di una lista di siti problematici. Questa lista è consultabile pubblicamente attraverso la navigazione ed un motore di ricerca interno.
A questo punto interviene Google.
Al fine di offrire dei risultati più sicuri, spiega Google, i risultati delle ricerche sono stati perfezionati integrando degli avvisi a fianco di ogni sito che sia contenuto nella blacklist.
Cosa succede se il vostro sito entra in blacklist?
Poco per volta arriviamo al punto cruciale del problema, ovvero: cosa succede se il vostro sito viene inserito in questa blacklist pericolosa?
Innanzi tutto sotto ad ogni titolo associato al vostro sito nei risultati di Google comparirà l'avviso che avete potuto leggere ad inizio articolo: This site may harm your computer. Nessuna altra modifica visibile compare nelle SERP.
La reale differenza si nota nel momento in cui un utente tenta di accedere ugualmente al risultato in lista. Invece di essere indirizzato direttamente alla pagina indicata, l'utente viene indirizzato verso una pagina intermedia che mostra un allarmante avviso, scritto a caratteri cubitali, che recita (click sull'immagine per visualizzare lo screenshot completo):
Attenzione - il sito al quale stai per accedere potrebbe contenere software dannoso per il tuo computer!
Figura 2 - Screenshot dell'avviso di Google
Oltre ad una serie di informazioni aggiuntive, la pagina riporta il collegamento all'URL precedentemente selezionato, nel caso l'utente desiderasse accedere ugualmente alla pagina. Non sempre l'indirizzo risulta "attivo" ma nella maggior parte dei casi va copiato ed incollato manualmente nella barr degli indirizzi del browser.
Dopo un percorso così tortuoso, quanti utenti pensate siano ancora interessati ad accedere alla vostra pagina? Come? Si avete ragione, la risposta è pochi!
Come prevenire l'inserimento in blacklist?
La prevenzione può avvenire esclusivamente con un'attenta ed adeguata analisi periodica e continuativa del sito, dei suoi contenuti e delle risorse pubblicate. In aggiunta, è fondamentale una scelta attenta e selezionata dei fornitori di pubblicità.
Figura 3 - Screenshot della notifica via Google Webmaster Tools
In secondo luogo, c'è da segnalare che Google ha recentemente introdotto un sistema di notifica che, in caso si verifichi una situazione di questo genere in condizione di buona fede, provvede ad inviare un'email al proprietario del sito provando indirizzi comuni come webmaster@nomedominio oppure info@nomedominio. Assicuratevi di disporre almeno di uno di questi indirizzi email.
Il pannello Google Webmaster Tools è un ottimo centro di controllo da tenere sempre sott'occhio. Nel caso di anomalie, un messaggio avvertirà della presenza di contenuti dannosi nel sito fornendo indicazioni e collegamenti utili per individuare il problema.
Cosa fare nel caso si entri nella blacklist di StopBadWare
Il sistema progettato da Google e StopBadWare non è infallibile e può capitare che un sito venga incluso per errore nella blacklist. Vediamo dunque come comportarci nel caso si presenti questa spiacevole situazione.
Controllare attentamente il sito
La prima attività deve essere quella di controllare attentamente l'intero sito. Non dimentichiamo di analizzare il nostro sito attraverso il pannello di controllo di Google Webmaster Tools che molto probabilmente riporterà una lista di URL che sono stati individuati come pericolosi.
Il primo passo è analizzare quegli indirizzi e correggere il problema, isolando la causa.
Inviare comunicazione a StopBadWare
Identificato e corretto il problema, è tempo di inviare comunicazione a StopBadWare seguendo queste semplici istruzioni fornite da Google. Inviate un'email, in inglese, a appeals@stopbadware.org specificando quale ritenete sia stata la causa dell'inserimento nella blacklist e quali sono le azioni correttive che avete eseguito.
StopBadWare provvederà ad analizzare la richiesta e fornire una risposta in 10 giorni lavorativi. In attesa della comunicazione potete eseguire verifiche direttamente interrogando il motore di ricerca presente nel sito. è ragionevole ritenere che se il sito viene rimosso dall'indice interno la risposta sarà positiva.
Attendete conferma scritta
Se vi siete comportati correttamente StopBadWare vi invierà conferma della rimozione del sito dall'elenco di quelli pericolosi e comunicherà i nuovi aggiornamenti a Google. A questo punto siete oramai verso la fine di questa brutta esperienza, non vi resta che attendere che Google aggiorni il proprio indice.
Dall'esperienza personale posso dirvi che sono passati circa 5-10 giorni dal mio invio dell'email a StopBadWare fino alla sua risposta. Contemporaneamente alla ricezione della conferma Google rimuoveva l'avviso associato alle pagine del mio sito.
In conclusione
Analizzare se il funzionamento di questo servizio sia efficace o meno non è obiettivo di questo articolo, nonostante abbia già avuto modo di esprimere la mia opinione e ritenga che ci siano diverse aree di miglioramento.
In sintesi, ricordatevi che non è solo importante mettere online un sito ma è altrettanto fondamentale assicurarsi che il tutto funzioni nel migliore dei modi!
Simone Carletti
Se qualcuno se lo stesse chiedendo, non sono impazzito e neppure sono stato ingaggiato per mettere in cattiva luce luce HTML.it. Quello che leggete ad inizio articolo è l'avviso, più o meno allarmante, che da qualche tempo compare a fianco di alcuni siti tra i risultati di Google, come lo screenshot seguente documenta (click sull'immagine per visualizzare lo screenshot completo):
Figura 1 - Screenshot di una SERP di Google con avviso
In questo articolo scopriremo meglio di cosa si tratta e, potendo parlare per esperienza vissuta, cercherò di fornirvi qualche indicazione utile per prevenire ma soprattutto "curare" questo problema.
A cosa fa riferimento questo avviso?
Dovete sapere che, a partire dall'inizio di febbraio 2007, Google ha attivato un servizio per segnalare agli utenti siti che potrebbero risultare potenzialmente pericolosi. Il servizio è attivo in collaborazione con il sito StopBadWare.org, un'organizzazione che si prefigge lo scopo di raccogliere e catalogare le segnalazioni di siti pericolosi.
Bene, direte voi a questo punto, ma cosa si intende per siti pericolosi?
Per siti pericolosi si intendono soprattutto quei siti che durante la navigazione potrebbero installare programmi dannosi al computer dell'utente, come spyware o dialer. Siti ricchi di popup con contenuti non esclusivamente sicuri, siti che riportano a loro volta un collegamento a siti definiti come a rischio.
Più marginalmente, questa lista include siti il cui obiettivo è phishing o frodi in termini di contenuti ed informazioni pubblicate.
Come anticipato in apertura, Google in collaborazione con StopBadWare ha attivato un servizio che, almeno inizialmente, dovrebbe proteggere l'ignaro utente dall'aprire siti pericolosi. Ma come funziona questo sistema? E soprattutto... funziona?
Il funzionamento del servizio di Google e StopBadWare.org
Procediamo con ordine, vedendo innanzitutto come si comporta questo servizio. Il motore dell'analisi è, contrariamente a quanti molti affermano, opera di StopBadWare.org. Questo sito si occupa di raccogliere e catalogare siti pericolosi. Le segnalazioni arrivano sia da Google, probabilmente grazie ad alcuni recenti aggiornamenti dell'algoritmo, sia dagli utenti stessi che possono inviare la loro segnalazione.
StopBadWare analizza singolarmente ogni report secondo le proprie linee guida e procede con la creazione di una lista di siti problematici. Questa lista è consultabile pubblicamente attraverso la navigazione ed un motore di ricerca interno.
A questo punto interviene Google.
Al fine di offrire dei risultati più sicuri, spiega Google, i risultati delle ricerche sono stati perfezionati integrando degli avvisi a fianco di ogni sito che sia contenuto nella blacklist.
Cosa succede se il vostro sito entra in blacklist?
Poco per volta arriviamo al punto cruciale del problema, ovvero: cosa succede se il vostro sito viene inserito in questa blacklist pericolosa?
Innanzi tutto sotto ad ogni titolo associato al vostro sito nei risultati di Google comparirà l'avviso che avete potuto leggere ad inizio articolo: This site may harm your computer. Nessuna altra modifica visibile compare nelle SERP.
La reale differenza si nota nel momento in cui un utente tenta di accedere ugualmente al risultato in lista. Invece di essere indirizzato direttamente alla pagina indicata, l'utente viene indirizzato verso una pagina intermedia che mostra un allarmante avviso, scritto a caratteri cubitali, che recita (click sull'immagine per visualizzare lo screenshot completo):
Attenzione - il sito al quale stai per accedere potrebbe contenere software dannoso per il tuo computer!
Figura 2 - Screenshot dell'avviso di Google
Oltre ad una serie di informazioni aggiuntive, la pagina riporta il collegamento all'URL precedentemente selezionato, nel caso l'utente desiderasse accedere ugualmente alla pagina. Non sempre l'indirizzo risulta "attivo" ma nella maggior parte dei casi va copiato ed incollato manualmente nella barr degli indirizzi del browser.
Dopo un percorso così tortuoso, quanti utenti pensate siano ancora interessati ad accedere alla vostra pagina? Come? Si avete ragione, la risposta è pochi!
Come prevenire l'inserimento in blacklist?
La prevenzione può avvenire esclusivamente con un'attenta ed adeguata analisi periodica e continuativa del sito, dei suoi contenuti e delle risorse pubblicate. In aggiunta, è fondamentale una scelta attenta e selezionata dei fornitori di pubblicità.
Figura 3 - Screenshot della notifica via Google Webmaster Tools
In secondo luogo, c'è da segnalare che Google ha recentemente introdotto un sistema di notifica che, in caso si verifichi una situazione di questo genere in condizione di buona fede, provvede ad inviare un'email al proprietario del sito provando indirizzi comuni come webmaster@nomedominio oppure info@nomedominio. Assicuratevi di disporre almeno di uno di questi indirizzi email.
Il pannello Google Webmaster Tools è un ottimo centro di controllo da tenere sempre sott'occhio. Nel caso di anomalie, un messaggio avvertirà della presenza di contenuti dannosi nel sito fornendo indicazioni e collegamenti utili per individuare il problema.
Cosa fare nel caso si entri nella blacklist di StopBadWare
Il sistema progettato da Google e StopBadWare non è infallibile e può capitare che un sito venga incluso per errore nella blacklist. Vediamo dunque come comportarci nel caso si presenti questa spiacevole situazione.
Controllare attentamente il sito
La prima attività deve essere quella di controllare attentamente l'intero sito. Non dimentichiamo di analizzare il nostro sito attraverso il pannello di controllo di Google Webmaster Tools che molto probabilmente riporterà una lista di URL che sono stati individuati come pericolosi.
Il primo passo è analizzare quegli indirizzi e correggere il problema, isolando la causa.
Inviare comunicazione a StopBadWare
Identificato e corretto il problema, è tempo di inviare comunicazione a StopBadWare seguendo queste semplici istruzioni fornite da Google. Inviate un'email, in inglese, a appeals@stopbadware.org specificando quale ritenete sia stata la causa dell'inserimento nella blacklist e quali sono le azioni correttive che avete eseguito.
StopBadWare provvederà ad analizzare la richiesta e fornire una risposta in 10 giorni lavorativi. In attesa della comunicazione potete eseguire verifiche direttamente interrogando il motore di ricerca presente nel sito. è ragionevole ritenere che se il sito viene rimosso dall'indice interno la risposta sarà positiva.
Attendete conferma scritta
Se vi siete comportati correttamente StopBadWare vi invierà conferma della rimozione del sito dall'elenco di quelli pericolosi e comunicherà i nuovi aggiornamenti a Google. A questo punto siete oramai verso la fine di questa brutta esperienza, non vi resta che attendere che Google aggiorni il proprio indice.
Dall'esperienza personale posso dirvi che sono passati circa 5-10 giorni dal mio invio dell'email a StopBadWare fino alla sua risposta. Contemporaneamente alla ricezione della conferma Google rimuoveva l'avviso associato alle pagine del mio sito.
In conclusione
Analizzare se il funzionamento di questo servizio sia efficace o meno non è obiettivo di questo articolo, nonostante abbia già avuto modo di esprimere la mia opinione e ritenga che ci siano diverse aree di miglioramento.
In sintesi, ricordatevi che non è solo importante mettere online un sito ma è altrettanto fondamentale assicurarsi che il tutto funzioni nel migliore dei modi!
Simone Carletti
Webmaster 'Google Approved'
Non c'è alcun dubbio sul fatto che creare un sito tanto per "essere in rete" non basta a dare visibilità, sia che si tratti di un sito a scopo professionale o dai contenuti personali o amatoriali. Ottenere i primi posti nei motori di ricerca è importante ma questo non deve essere perseguito utilizzando sotterfugi nocivi alle esigenze ed all'ingenuità dei navigatori della Rete. Vedremo dunque con questo articolo quali tecniche Google considera nocive o illegali.
Una fetta di paradiso
Le tecniche per alzare la popolarità dei siti e scalare le classifiche dei motori di ricerca sono innumerevoli e sono continuo oggetto di studio da parte di chi ha innalzato la ricerca di una fetta di visibilità a vero e proprio lavoro. Mi riferisco naturalmente ai SEO e a tutti coloro che lavorano nel campo dell'ottimizzazione dei contenuti per i motori di ricerca.
Parlando di search engines non si può non parlare di Google e delle linee guida per webmaster che, più semplicemente, possono aiutare il webmaster a creare un sito visibile e "Google approved", ovvero che non rischi di essere bannato dagli indici perché utilizza delle soluzioni volte ad ottenere una visibilità posticcia, forzata e non orientata alle esigenze del visitatore.
Ciò che Google a diritto chiede è un po' di onestà intellettuale e lavorativa, il seguire delle linee guida che garantiscano la qualità dei contenuti di un sito evitando pratiche illecite volte solo al raggiungimento dei gradini più alti.
Grafica e contenuti
Da cosa si riconosce un sito di qualità? Innanzitutto dalla pertinenza dei contenuti e dalla loro chiarezza. Un sito ricco di informazioni e ben organizzato è più utile di un sito con contenuti falsamente informativi e talmente mal organizzato che ci si perde nella navigazione interna. Per un sito che abbia diversi livelli e sottolivelli può essere utile offrire agli utenti una mappa del sito che li aiuterà ad orientarsi e consentirà a voi di creare un'architettura grafica più lineare.
I robots dei motori di ricerca, dei piccoli software che navigano il vostro sito in lungo ed in largo indicizzandone i contenuti, riconoscono principalmente testo e link statici. Assicuratevi dunque di utilizzare nel testo le parole chiave con cui volete essere trovati e siate certi che tutte le parti del sito siano raggiungibili tramite almeno un link statico poiché, benché nelle ultime versioni vengano ormai ufficialmente riconosciuti i link dinamici, il link statico viene comunque navigato ed indicizzato meglio.
Le immagini non vengono lette dal motore di ricerca quindi evitate di affidare loro contenuti importanti e non trascurate l'attributo ALT.
ALT è il testo alternativo che, se inserito, compare quando l'immagine non è visibile (anche se, erroneamente, su Internet Explorer compare come fosse un TITLE quando si passa con il mouse sopra l'immagine).
I robot si comportano come degli utenti che visualizzano la pagina con un browser testuale, non "vedono" le immagini ma a loro posto leggono il contenuto dell'attributo ALT. Al fine di una migliore indicizzazione vanno possibilmente inserite nel tag parole chiave descrittive, magari scrivendo una frase espressiva che contenga più parole chiavi.
Nell'immagine di seguito vediamo come nel sito Microsoft ( e con Internet Explorer) viene gestito l'attributo ALT in riferimento alle funzionalità di Windows Media Center:
Figura 1 - Attributo ALT per Windows Media Center
Linee guida tecniche
Naturalmente oltre all'implementazione grafica ci sono alcuni punti tecnici che non vanno trascurati. Come abbiamo già detto gli spiders dei motori di ricerca vedono il vostro sito come in un browser testuale. Va da sé che è meglio evitare quanto più possibile elementi in Flash, JavaScript, frame e tutto quanto può "confondere" il robot. È da approvare invece un buon foglio CSS in quanto permette un uso più pulito del codice facilitano l'applicazione di modificatori di enfatizzazione del testo, come i tag H1, H2, H3 etc, permettendo una migliore gerarchizzazione dei contenuti.
Fate uso del file robots.txt. Il file robots.txt non è altro che un file di testo con cui istruite il robots del motore di ricerca ad indicizzare questo o quel contenuto del vostro sito e ad ignorare quello che invece non volete venga indicizzato. Questo file va inserito nella root principale del dominio. Google mette a disposizione diversi strumenti utili alla creazione di robots.txt, al suo controllo, per evitare che inavvertitamente blocchi la navigazione di Googlebot, alla sua gestione. A questo proposito consiglio la lettura della specifica pagina Strumenti per Webmaster di Google (in inglese). Ricordate però che non tutti i robots dei motori di ricerca utilizzano le stesse meccaniche e che questi strumenti di gestione consigliati sono validi solo per Googlebot.
I principi di qualità che fanno la differenza
Il consiglio è di attenersi scrupolosamente alle linee guida implementate e diffuse da Google nella pagina Webmaster Guidelines (in inglese), non utilizzare comportamenti illeciti evitando così il rischio di essere penalizzati o del tutto rimossi dagli indici del motore di ricerca.
Le linee guida sulla qualità possono così essere sintetizzate:
Non registrare domini il cui spelling errato può essere ricondotto ad altri siti famosi. In Italia questo si verifica ad esempio con i ben noti siti di Pagine Bianche, Pagine Gialle e Tutto Città. Digitandone l'URL in maniera errata invece dei servizi richiesti ci si trova in pagine web di siti dal contenuto quanto meno dubbio e del tutto non pertinente.
Evitate fenomeni di "cloaking". Il cloaking è l'azione di mostrare allo spider un contenuto differente rispetto a quello che il sito propone ai visitatori. Il fine è ottimizzare la pagina in vista del passaggio e del robot e della conseguente indicizzazione. Il motore di ricerca trova determinate parole chiave, enfatizzazioni, link ad altri siti e valuta quel sito popolare quando in realtà non lo è. Si tratta naturalmente di una tecnica altamente scorretta e ormai facilmente individuabile dai nuovi algoritmi di ricerca.
Evitate link a siti di spam. Non partecipate a servizi di scambio link con siti che non abbiano pertinenza con i vostri contenuti. Siate certi se lo fate che aggiungano valore e contenuto al vostro sito.
Non utilizzate software che inviino continue richieste al motore di ricerca o script automatici per cliccare link al vostro sito per aumentarne la popolarità.
Non usate testo nascosto, link nascosti e non riempite le pagine di parole chiave "popolari" (ad esempio com'è ovvio la parola "sex") che non hanno attinenza con i vostri contenuti.
Non realizzare doorway. Le doorway sono pagine quasi prive di grafica e contenuti tranne che per la ripetizione ossessiva delle parole chiave, di link legati allo stesso circuito e caratterizzate dal redirect al sito principale. In pratica implicano la registrazione di molti domini contenenti parole chiave pertinenti già nell'URL, ottimizzate per il motore di ricerca e che fanno da "porta d'accesso" al sito vero e proprio tramite il redirect.
Non create domini e subdomini dal contenuto duplicato.
Non inserire link che provochino il download nascosto di elementi nocivi.
Ricordate che è molto più importante e fruttuoso occupare il proprio tempo a pensare come garantire una migliore esperienza di navigazione nel vostro sito all'utente che perdere energie a cercare trucchi per ottenere un Ranking migliore.
Quando il sito è infine pronto l'indirizzo va inviato al servizio Aggiunta/Rimozione di un URL di Google e naturalmente anche a tutti gli altri motori di ricerca. E' bene assicurarsi di avere una buona rete di link da e verso siti pertinenti poiché questo aiuta ad incrementare il vostro PageRank offrendo agli utenti approfondimenti in relazione ai contenuti che cercano.
Conclusioni
Creare un sito "Google approved" è semplice, basta tenere sempre presente che il lavoro che si sta facendo è principalmente volto a persone, di tutte le età e di tutti i gradi di competenza, che trovando il vostro sito nei più alti indici del motore di ricerca credono, sperano, di aver trovato una preziosa fonte di informazioni o risorse. Che questa fonte sia totalmente gratuita o richieda un impegno economico è di secondaria importanza, ciò che si richiede ai webmaster non è necessariamente di fare beneficenza ma di essere onesti nei contenuti che offrono.
Ester Liquori
Una fetta di paradiso
Le tecniche per alzare la popolarità dei siti e scalare le classifiche dei motori di ricerca sono innumerevoli e sono continuo oggetto di studio da parte di chi ha innalzato la ricerca di una fetta di visibilità a vero e proprio lavoro. Mi riferisco naturalmente ai SEO e a tutti coloro che lavorano nel campo dell'ottimizzazione dei contenuti per i motori di ricerca.
Parlando di search engines non si può non parlare di Google e delle linee guida per webmaster che, più semplicemente, possono aiutare il webmaster a creare un sito visibile e "Google approved", ovvero che non rischi di essere bannato dagli indici perché utilizza delle soluzioni volte ad ottenere una visibilità posticcia, forzata e non orientata alle esigenze del visitatore.
Ciò che Google a diritto chiede è un po' di onestà intellettuale e lavorativa, il seguire delle linee guida che garantiscano la qualità dei contenuti di un sito evitando pratiche illecite volte solo al raggiungimento dei gradini più alti.
Grafica e contenuti
Da cosa si riconosce un sito di qualità? Innanzitutto dalla pertinenza dei contenuti e dalla loro chiarezza. Un sito ricco di informazioni e ben organizzato è più utile di un sito con contenuti falsamente informativi e talmente mal organizzato che ci si perde nella navigazione interna. Per un sito che abbia diversi livelli e sottolivelli può essere utile offrire agli utenti una mappa del sito che li aiuterà ad orientarsi e consentirà a voi di creare un'architettura grafica più lineare.
I robots dei motori di ricerca, dei piccoli software che navigano il vostro sito in lungo ed in largo indicizzandone i contenuti, riconoscono principalmente testo e link statici. Assicuratevi dunque di utilizzare nel testo le parole chiave con cui volete essere trovati e siate certi che tutte le parti del sito siano raggiungibili tramite almeno un link statico poiché, benché nelle ultime versioni vengano ormai ufficialmente riconosciuti i link dinamici, il link statico viene comunque navigato ed indicizzato meglio.
Le immagini non vengono lette dal motore di ricerca quindi evitate di affidare loro contenuti importanti e non trascurate l'attributo ALT.
ALT è il testo alternativo che, se inserito, compare quando l'immagine non è visibile (anche se, erroneamente, su Internet Explorer compare come fosse un TITLE quando si passa con il mouse sopra l'immagine).
I robot si comportano come degli utenti che visualizzano la pagina con un browser testuale, non "vedono" le immagini ma a loro posto leggono il contenuto dell'attributo ALT. Al fine di una migliore indicizzazione vanno possibilmente inserite nel tag parole chiave descrittive, magari scrivendo una frase espressiva che contenga più parole chiavi.
Nell'immagine di seguito vediamo come nel sito Microsoft ( e con Internet Explorer) viene gestito l'attributo ALT in riferimento alle funzionalità di Windows Media Center:
Figura 1 - Attributo ALT per Windows Media Center
Linee guida tecniche
Naturalmente oltre all'implementazione grafica ci sono alcuni punti tecnici che non vanno trascurati. Come abbiamo già detto gli spiders dei motori di ricerca vedono il vostro sito come in un browser testuale. Va da sé che è meglio evitare quanto più possibile elementi in Flash, JavaScript, frame e tutto quanto può "confondere" il robot. È da approvare invece un buon foglio CSS in quanto permette un uso più pulito del codice facilitano l'applicazione di modificatori di enfatizzazione del testo, come i tag H1, H2, H3 etc, permettendo una migliore gerarchizzazione dei contenuti.
Fate uso del file robots.txt. Il file robots.txt non è altro che un file di testo con cui istruite il robots del motore di ricerca ad indicizzare questo o quel contenuto del vostro sito e ad ignorare quello che invece non volete venga indicizzato. Questo file va inserito nella root principale del dominio. Google mette a disposizione diversi strumenti utili alla creazione di robots.txt, al suo controllo, per evitare che inavvertitamente blocchi la navigazione di Googlebot, alla sua gestione. A questo proposito consiglio la lettura della specifica pagina Strumenti per Webmaster di Google (in inglese). Ricordate però che non tutti i robots dei motori di ricerca utilizzano le stesse meccaniche e che questi strumenti di gestione consigliati sono validi solo per Googlebot.
I principi di qualità che fanno la differenza
Il consiglio è di attenersi scrupolosamente alle linee guida implementate e diffuse da Google nella pagina Webmaster Guidelines (in inglese), non utilizzare comportamenti illeciti evitando così il rischio di essere penalizzati o del tutto rimossi dagli indici del motore di ricerca.
Le linee guida sulla qualità possono così essere sintetizzate:
Non registrare domini il cui spelling errato può essere ricondotto ad altri siti famosi. In Italia questo si verifica ad esempio con i ben noti siti di Pagine Bianche, Pagine Gialle e Tutto Città. Digitandone l'URL in maniera errata invece dei servizi richiesti ci si trova in pagine web di siti dal contenuto quanto meno dubbio e del tutto non pertinente.
Evitate fenomeni di "cloaking". Il cloaking è l'azione di mostrare allo spider un contenuto differente rispetto a quello che il sito propone ai visitatori. Il fine è ottimizzare la pagina in vista del passaggio e del robot e della conseguente indicizzazione. Il motore di ricerca trova determinate parole chiave, enfatizzazioni, link ad altri siti e valuta quel sito popolare quando in realtà non lo è. Si tratta naturalmente di una tecnica altamente scorretta e ormai facilmente individuabile dai nuovi algoritmi di ricerca.
Evitate link a siti di spam. Non partecipate a servizi di scambio link con siti che non abbiano pertinenza con i vostri contenuti. Siate certi se lo fate che aggiungano valore e contenuto al vostro sito.
Non utilizzate software che inviino continue richieste al motore di ricerca o script automatici per cliccare link al vostro sito per aumentarne la popolarità.
Non usate testo nascosto, link nascosti e non riempite le pagine di parole chiave "popolari" (ad esempio com'è ovvio la parola "sex") che non hanno attinenza con i vostri contenuti.
Non realizzare doorway. Le doorway sono pagine quasi prive di grafica e contenuti tranne che per la ripetizione ossessiva delle parole chiave, di link legati allo stesso circuito e caratterizzate dal redirect al sito principale. In pratica implicano la registrazione di molti domini contenenti parole chiave pertinenti già nell'URL, ottimizzate per il motore di ricerca e che fanno da "porta d'accesso" al sito vero e proprio tramite il redirect.
Non create domini e subdomini dal contenuto duplicato.
Non inserire link che provochino il download nascosto di elementi nocivi.
Ricordate che è molto più importante e fruttuoso occupare il proprio tempo a pensare come garantire una migliore esperienza di navigazione nel vostro sito all'utente che perdere energie a cercare trucchi per ottenere un Ranking migliore.
Quando il sito è infine pronto l'indirizzo va inviato al servizio Aggiunta/Rimozione di un URL di Google e naturalmente anche a tutti gli altri motori di ricerca. E' bene assicurarsi di avere una buona rete di link da e verso siti pertinenti poiché questo aiuta ad incrementare il vostro PageRank offrendo agli utenti approfondimenti in relazione ai contenuti che cercano.
Conclusioni
Creare un sito "Google approved" è semplice, basta tenere sempre presente che il lavoro che si sta facendo è principalmente volto a persone, di tutte le età e di tutti i gradi di competenza, che trovando il vostro sito nei più alti indici del motore di ricerca credono, sperano, di aver trovato una preziosa fonte di informazioni o risorse. Che questa fonte sia totalmente gratuita o richieda un impegno economico è di secondaria importanza, ciò che si richiede ai webmaster non è necessariamente di fare beneficenza ma di essere onesti nei contenuti che offrono.
Ester Liquori
Le affordance dei motori di ricerca e la razionalità limitata dei navigatori
In che modo gli utenti usano i motori di ricerca? Quanto e come sfruttano le molteplici opzioni che sono loro offerte? Sono informazioni che possono essere utili anche a chi quotidianamente studia i motori ai fini del posizionamento e dell'ottimizzazione. In questo articolo sono presentati i risultati di una ricerca di tipo qualitativo che ha visto la partecipazione di 31 utenti. Tema: i concetti di affordance e razionalità limitata applicati ai motori di ricerca.
Le affordance del motore di ricerca
Il motore di ricerca lo possiamo pensare come ad un artefatto cognitivo. Norman definisce un artefatto cognitivo come "un dispositivo artificiale che svolge una funzione di rappresentazione, progettato per presentare, mantenere e operare sull'informazione".
Un esempio è sicuramente il computer. Esso permette di effettuare una serie di compiti molto complessi a fronte di un periodo più o meno lungo di apprendimento.
Il motore di ricerca è quindi un artefatto cognitivo, in quanto permette di effettuare una ricerca organizzando i risultati, evidenziando le attinenze e visualizzando sue elaborazioni.
Ogni artefatto ha delle affordance, delle operazioni che esso consente di fare e quindi delle possibili funzioni dell'oggetto. Un esempio. La matita invita ad essere sollevata, afferrata, girata, inoltre con essa è possibile fare altre operazioni quali bucare, sostenere, battere e poi naturalmente scrivere. Si può quindi pensare alle affordance a come delle possibilità operative offerte da un artefatto.
Cosa ci invita a fare il motore di ricerca? Oltre a ricercare delle informazioni attraverso l'inserimento di parole chiave, o a volte attraverso le categorie, ci offre la possibilità di utilizzare le sezioni diversificate e la ricerca avanzata.
Le sezioni diversificate sono delle sottocategorie di informazioni come per esempio le sezioni immagini, gruppi, directory, news ecc. in Google; le sezioni aziende, prodotti, persone, immagini ecc. in Virgilio; le sezioni desktop, notizie, immagini, Encarta, locale ecc. in Msn. Inoltre ogni motore dà ai propri utenti la possibilità di specificare meglio i termini della ricerca da effettuare attraverso quella che viene definita ricerca avanzata.
Diventa importante capire se queste affordance del motore di ricerca siano percepite dai navigatori (affordance percepite) come possibilità operative dell'artefatto oppure no.
Spesso si tende ad utilizzare gli strumenti in modi che vengono suggeriti dalle loro affordance più salienti e non in modi che invece sono difficili da scoprire. Nei cellulari di ultima generazione vi sono tante funzioni potenti che spesso non vengono utilizzate dai loro possessori e molte volte neppure conosciute.
Attraverso un'indagine di tipo qualitativo, nella quale si sono osservati 31 partecipanti volontari (di cui 16 di prova) mentre effettuavano varie ricerche on-line, si è verificato se gli utenti utilizzassero la ricerca avanzata, le sezioni diversificate dei motori di ricerca e le motivazioni del mancato utilizzo.
Figura 1 - Tabella con i risultati della ricerca
Nella tabella riportata qui sopra si può notare come solamente 3 partecipanti su 15 utilizzano la ricerca avanzata. Inoltre, 6 delle 12 persone che non la utilizzano non la conoscono. Alcuni utenti (solo 3) la conoscono, ma la utilizzano solamente in casi particolari, cioè quando la ricerca è complessa o devono inserire molte parole chiave.
La ricerca avanzata non sembra essere un'affordance percepita dagli utenti. Una buona parte dei partecipanti, infatti, non la conosce ed inoltre altri partecipanti non la ritengono utile, portandoli spesso ad ignorarla del tutto.
A differenza della ricerca avanzata, la maggior parte dei partecipanti (12 su 15) utilizza e conosce le sezioni diversificate dei motori di ricerca.
La ricerca che è stata fatta svolgere ai partecipanti consisteva nel trovare un' immagine. La maggior parte di essi entrava nella rispettiva sezione, anche se in alcuni partecipanti affermavano di conoscere solo quella sezione o alcune di esse.
Secondo quest'indagine, i navigatori percepiscono come affordance del MdR (tra quelle prese in considerazione) solo le sezioni diversificate, anche se non ne hanno una totale consapevolezza. Spesso i navigatori conoscono solo alcune delle sezioni e quindi solo parte delle possibilità operative che il motore gli offre.
La razionalità limitata applicata ai motori di ricerca
In passato vi sono stati vivaci dibattiti tra chi pensava che la mente umana dovrebbe tendere ad avvicinarsi alle prestazioni di una macchina e chi invece sosteneva essere fondamentale, per la buona riuscita di un compito, economizzare gli sforzi, senza prefiggersi di arrivare alla soluzione ottima, ma ad un risultato soddisfacente.
Quest'ultima visione è stata perseguita da Simon. Essendo la mente umana fortemente vincolata da limiti attenzionali, di memoria e di coerenza delle conoscenze, l'autore crede sia razionale accontentarsi di prestazioni cognitive soddisfacenti. L'ulteriore sforzo che l'individuo compierebbe per arrivare al massimo grado di conoscenza, infatti, non verrebbe compensato da risultati proporzionalmente migliori.
Il raggiungimento dei risultati, quindi, dovrebbe avvenire attraverso un modo di operare definito razionalità limitata e non attraverso quella che, in contrapposizione, viene definita razionalità olimpica. In questo modo l'uomo ha la possibilità di adattarsi in modo intelligente ai vincoli che il cervello gli impone.
Per spiegare meglio la differenza tra razionalità olimpica e razionalità limitata occorre con un esempio. C'è un uomo che deve recarsi in banca con la propria automobile. La razionalità olimpica lo porterebbe a cercare di arrivare il più vicino possibile all'edificio, rischiando, però, di perdere molto tempo, senza la certezza di riuscirci. Al contrario potrebbe accontentarsi di posteggiare nelle vicinanze e fare un piccolo pezzo a piedi. Con questa seconda strategia (razionalità limitata), eviterebbe di perdere molto tempo nella ricerca di un posto vicino, per poi rinunciarvi e parcheggiare comunque lontano, con un dispendio di risorse più contenuto (ottimo locale).
Il voler sempre raggiungere l'apice delle possibilità, infatti, può significare il dispendio di risorse mancanti poi nell'applicazione della conoscenza o, addirittura, l'impossibilità di raggiungere quello che si ritiene l'obiettivo reale, appunto per l'esaurirsi delle risorse stesse. Inoltre, il voler esaminare tutte le infinite possibilità, può significare il non rendersi conto che non esista ulteriore margine di miglioramento. Viceversa, la capacità di stimare il livello sufficiente del grado di precisione di un'informazione cercata, una volta che la si trovi, implica la conservazione delle energie necessarie per il successivo trattamento.
Le informazioni che è possibile reperire attraverso Internet sono in grandissima quantità. Uno strumento che aiuta gli utenti nella navigazione di tali risorse è sicuramente il motore di ricerca. Esso dà la possibilità al navigatore di trovare le informazioni che si avvicinino il più possibile alle sue esigenze, a ciò di cui in quel momento ha bisogno.
Si può ipotizzare che gli utenti, non avendo una rappresentazione completa dell'insieme delle informazioni che li porterebbe ad ottimizzare la ricerca, semplifichino il processo, arrivando all'ottimo locale. Avendo delle risorse limitate, per esempio lo sforzo dato dalla quantità di tempo e di energie che un compito richiede, risulta essere fondamentale adattare quest'ultimo per giungere ad un risultato che sia, se non ottimo, soddisfacente.
Attraverso un'indagine di tipo qualitativo, nella quale si sono osservati 31 partecipanti volontari (di cui 16 di prova) mentre effettuavano varie ricerche on-line, si è verificato se gli utenti, dopo una prima informazione soddisfacente, effettuavano altre ricerche o si fermavano e in quest'ultimo caso quanto fossero soddisfatti di ciò che avevano trovato.
Figura 2 - Tabella con i risultati della ricerca
I partecipanti che, soddisfatti da una prima informazione trovata, proseguono per avere delle alternative di scelta o per confermare ciò che hanno trovato sono solo 3 su 15. Non avendo una rappresentazione completa delle informazioni che consentirebbe di ottimizzare la ricerca (cognitivamente è molto dispendioso acquisirla) i navigatori semplificano il processo di ricerca, arrivando a ciò che possiamo definire ottimo locale. Per esempio, nella prima ricerca, la maggior parte dei partecipanti (9 su 15) giunti alla prima informazione soddisfacente, affermano di ritenersi molto soddisfatti.
I partecipanti si accontentano quindi di ottenere delle prestazioni soddisfacenti, limitati dall'aumento delle risorse cognitive che dovrebbero impiegare per tentare di arrivare all'ottimizzazione.
Mariangela Balsamo
Le affordance del motore di ricerca
Il motore di ricerca lo possiamo pensare come ad un artefatto cognitivo. Norman definisce un artefatto cognitivo come "un dispositivo artificiale che svolge una funzione di rappresentazione, progettato per presentare, mantenere e operare sull'informazione".
Un esempio è sicuramente il computer. Esso permette di effettuare una serie di compiti molto complessi a fronte di un periodo più o meno lungo di apprendimento.
Il motore di ricerca è quindi un artefatto cognitivo, in quanto permette di effettuare una ricerca organizzando i risultati, evidenziando le attinenze e visualizzando sue elaborazioni.
Ogni artefatto ha delle affordance, delle operazioni che esso consente di fare e quindi delle possibili funzioni dell'oggetto. Un esempio. La matita invita ad essere sollevata, afferrata, girata, inoltre con essa è possibile fare altre operazioni quali bucare, sostenere, battere e poi naturalmente scrivere. Si può quindi pensare alle affordance a come delle possibilità operative offerte da un artefatto.
Cosa ci invita a fare il motore di ricerca? Oltre a ricercare delle informazioni attraverso l'inserimento di parole chiave, o a volte attraverso le categorie, ci offre la possibilità di utilizzare le sezioni diversificate e la ricerca avanzata.
Le sezioni diversificate sono delle sottocategorie di informazioni come per esempio le sezioni immagini, gruppi, directory, news ecc. in Google; le sezioni aziende, prodotti, persone, immagini ecc. in Virgilio; le sezioni desktop, notizie, immagini, Encarta, locale ecc. in Msn. Inoltre ogni motore dà ai propri utenti la possibilità di specificare meglio i termini della ricerca da effettuare attraverso quella che viene definita ricerca avanzata.
Diventa importante capire se queste affordance del motore di ricerca siano percepite dai navigatori (affordance percepite) come possibilità operative dell'artefatto oppure no.
Spesso si tende ad utilizzare gli strumenti in modi che vengono suggeriti dalle loro affordance più salienti e non in modi che invece sono difficili da scoprire. Nei cellulari di ultima generazione vi sono tante funzioni potenti che spesso non vengono utilizzate dai loro possessori e molte volte neppure conosciute.
Attraverso un'indagine di tipo qualitativo, nella quale si sono osservati 31 partecipanti volontari (di cui 16 di prova) mentre effettuavano varie ricerche on-line, si è verificato se gli utenti utilizzassero la ricerca avanzata, le sezioni diversificate dei motori di ricerca e le motivazioni del mancato utilizzo.
Figura 1 - Tabella con i risultati della ricerca
Nella tabella riportata qui sopra si può notare come solamente 3 partecipanti su 15 utilizzano la ricerca avanzata. Inoltre, 6 delle 12 persone che non la utilizzano non la conoscono. Alcuni utenti (solo 3) la conoscono, ma la utilizzano solamente in casi particolari, cioè quando la ricerca è complessa o devono inserire molte parole chiave.
La ricerca avanzata non sembra essere un'affordance percepita dagli utenti. Una buona parte dei partecipanti, infatti, non la conosce ed inoltre altri partecipanti non la ritengono utile, portandoli spesso ad ignorarla del tutto.
A differenza della ricerca avanzata, la maggior parte dei partecipanti (12 su 15) utilizza e conosce le sezioni diversificate dei motori di ricerca.
La ricerca che è stata fatta svolgere ai partecipanti consisteva nel trovare un' immagine. La maggior parte di essi entrava nella rispettiva sezione, anche se in alcuni partecipanti affermavano di conoscere solo quella sezione o alcune di esse.
Secondo quest'indagine, i navigatori percepiscono come affordance del MdR (tra quelle prese in considerazione) solo le sezioni diversificate, anche se non ne hanno una totale consapevolezza. Spesso i navigatori conoscono solo alcune delle sezioni e quindi solo parte delle possibilità operative che il motore gli offre.
La razionalità limitata applicata ai motori di ricerca
In passato vi sono stati vivaci dibattiti tra chi pensava che la mente umana dovrebbe tendere ad avvicinarsi alle prestazioni di una macchina e chi invece sosteneva essere fondamentale, per la buona riuscita di un compito, economizzare gli sforzi, senza prefiggersi di arrivare alla soluzione ottima, ma ad un risultato soddisfacente.
Quest'ultima visione è stata perseguita da Simon. Essendo la mente umana fortemente vincolata da limiti attenzionali, di memoria e di coerenza delle conoscenze, l'autore crede sia razionale accontentarsi di prestazioni cognitive soddisfacenti. L'ulteriore sforzo che l'individuo compierebbe per arrivare al massimo grado di conoscenza, infatti, non verrebbe compensato da risultati proporzionalmente migliori.
Il raggiungimento dei risultati, quindi, dovrebbe avvenire attraverso un modo di operare definito razionalità limitata e non attraverso quella che, in contrapposizione, viene definita razionalità olimpica. In questo modo l'uomo ha la possibilità di adattarsi in modo intelligente ai vincoli che il cervello gli impone.
Per spiegare meglio la differenza tra razionalità olimpica e razionalità limitata occorre con un esempio. C'è un uomo che deve recarsi in banca con la propria automobile. La razionalità olimpica lo porterebbe a cercare di arrivare il più vicino possibile all'edificio, rischiando, però, di perdere molto tempo, senza la certezza di riuscirci. Al contrario potrebbe accontentarsi di posteggiare nelle vicinanze e fare un piccolo pezzo a piedi. Con questa seconda strategia (razionalità limitata), eviterebbe di perdere molto tempo nella ricerca di un posto vicino, per poi rinunciarvi e parcheggiare comunque lontano, con un dispendio di risorse più contenuto (ottimo locale).
Il voler sempre raggiungere l'apice delle possibilità, infatti, può significare il dispendio di risorse mancanti poi nell'applicazione della conoscenza o, addirittura, l'impossibilità di raggiungere quello che si ritiene l'obiettivo reale, appunto per l'esaurirsi delle risorse stesse. Inoltre, il voler esaminare tutte le infinite possibilità, può significare il non rendersi conto che non esista ulteriore margine di miglioramento. Viceversa, la capacità di stimare il livello sufficiente del grado di precisione di un'informazione cercata, una volta che la si trovi, implica la conservazione delle energie necessarie per il successivo trattamento.
Le informazioni che è possibile reperire attraverso Internet sono in grandissima quantità. Uno strumento che aiuta gli utenti nella navigazione di tali risorse è sicuramente il motore di ricerca. Esso dà la possibilità al navigatore di trovare le informazioni che si avvicinino il più possibile alle sue esigenze, a ciò di cui in quel momento ha bisogno.
Si può ipotizzare che gli utenti, non avendo una rappresentazione completa dell'insieme delle informazioni che li porterebbe ad ottimizzare la ricerca, semplifichino il processo, arrivando all'ottimo locale. Avendo delle risorse limitate, per esempio lo sforzo dato dalla quantità di tempo e di energie che un compito richiede, risulta essere fondamentale adattare quest'ultimo per giungere ad un risultato che sia, se non ottimo, soddisfacente.
Attraverso un'indagine di tipo qualitativo, nella quale si sono osservati 31 partecipanti volontari (di cui 16 di prova) mentre effettuavano varie ricerche on-line, si è verificato se gli utenti, dopo una prima informazione soddisfacente, effettuavano altre ricerche o si fermavano e in quest'ultimo caso quanto fossero soddisfatti di ciò che avevano trovato.
Figura 2 - Tabella con i risultati della ricerca
I partecipanti che, soddisfatti da una prima informazione trovata, proseguono per avere delle alternative di scelta o per confermare ciò che hanno trovato sono solo 3 su 15. Non avendo una rappresentazione completa delle informazioni che consentirebbe di ottimizzare la ricerca (cognitivamente è molto dispendioso acquisirla) i navigatori semplificano il processo di ricerca, arrivando a ciò che possiamo definire ottimo locale. Per esempio, nella prima ricerca, la maggior parte dei partecipanti (9 su 15) giunti alla prima informazione soddisfacente, affermano di ritenersi molto soddisfatti.
I partecipanti si accontentano quindi di ottenere delle prestazioni soddisfacenti, limitati dall'aumento delle risorse cognitive che dovrebbero impiegare per tentare di arrivare all'ottimizzazione.
Mariangela Balsamo
Iscriviti a:
Post (Atom)