31 oktober 2008
Door gebruik te maken van een OCR (optical character recognition) technologie is Google er in geslaagd om de geconverteerde tekst van PDF-scans beschikbaar te maken in de zoekresultaten van haar zoekmachine door gebruik te maken van de 'View as HTML' link. Google verklaarde donderdag 30 oktober dat het begonnen was 'turning electronic copies of printed documents — PDF files generated from scanned paper — back into digital text using optical character-recognition (OCR) technology'. Evin Levey, product manager bij Google, schreef in een blog post dat 'In the past, scanned documents were rarely included in search results as we couldn't be sure of their content. We had occasional clues from references to the document — so you might get a search result with a title but no snippet highlighting your query. Today, that changes. We are now able to perform OCR on any scanned documents that we find stored inAdobe 's PDF format'. Als voorbeeld een document van de Consumer Product Safety Commission (CPSC) dat als scan nu middels HTML zichtbaar en leesbaar is. Bij Yahoo, Microsoft en Ask werd hetzelfde document als PDF gevonden, maar was het niet als een HTML te lezen. Bij niet gescande PDF's was dezelfde optie al geruime tijd beschikbaar. Het is een interessante optie, omdat er nu een enorme hoeveelheid documenten op een betere manier toegankelijk te maken is.
