Visar inlägg med etikett Scangate. Visa alla inlägg
Visar inlägg med etikett Scangate. Visa alla inlägg

måndag 5 september 2011

GUB: Halvautomatik

Tillbaka igen efter semesteruppehållet har digitalduon på GUB ägnat de senaste veckorna åt att finjustera vårt Scanflow-flöde. Och till vår stora glädje verkar vi ha kommit ett par steg närmare en till stora delar automatiserad process. Som vi tidigare nämnt kan programmet vara oerhört känsligt, det kraschar med jämna mellanrum och det är sällan helt uppenbart varför detta sker. Något som vi kämpat med ett tag är avbrutna flöden, där automatiken avbrutits eftersom programmet inte fått tillräcklig information för att utföra en viss operation. Eftersom Scanflow i sådana fall bara (i bästa fall) ger feedback i formen av: ”nu har någonting gått fel” och inte vidare specificerar hur problemet kan rättas till, är det lätt att fastna i långa perioder av felsökning. Så när vi testat har det varit silkesvantar på hela vägen och varje uppgift (task) har isolerats och testats grundligt innan vi passat in den i en mer komplex sekvens.

Slutprodukterna av vårt testflöde är masterfiler i TIFF (separerade sidor) samt en bitonal sökbar pdf i 400 dpi, med omslag i färg, som är redo för metadataberikning och därefter tillgängliggörande i GUPEA (lokal databas) och LIBRIS.


Så här har vi jobbat fram till idag:

Förberedelser

  1. Objekten har skickats till oss från pedagogiska institutionen.
  2. Utifrån ett antal kriterier har objekten sorterats i två grupper; de som ska hanteras i treventusrobot resp. arkmatare.
  3. Varje objekt har sedan registrerats i en specialgjord databas, där vi tilldelat ett objekt id-nummer, registrerat dess titel och författare, v ilken typ av skanner som det ska hanteras i, samt vilken status det har (skannat/oskannat ).

  4. Objektens databasposter har skrivits ut på papper som placerats i de fysiska objekten.
  5. Bokbinderiet har skurit och sprättat objekten som ska hanteras i arkskannern.


Scangate (manuell)

Samtliga osprättade objekt har skannats i treventusroboten. Processen ser ut enligt följande:

  1. Ett nytt jobb skapas och döps till det id-nummer det är registrerat under i databasen. Programmet skapar automatiskt en mapp i Windows som den sedan placerar alla skannade sidor i.
  2. Verket skannas och masterfiler genereras. Varken framsidor, baksidor eller eventuella lösa ark skannas dock i detta läge.
  3. Efter skanningen avslutats kontrolleras det att digitaliseringen av verket är fullständig. Vid ofullständig digitalisering kompletteras verket då så är möjligt. Går verket inte att komplettera noteras detta på pappret som ligger i objektet.
  4. Work-filer genereras.
  5. I Work-vyn räknas ramvärdena ut (calculate borders).
  6. I Work-vyn sätts en beskärningsram.
  7. Arbetet sparas och skickas in i flödet (finalize task).


Scanflow (automatisk)

Stegen ovan upprepas för varje objekt. Efter punkt 7, tar det automatiska flödet vid. Man kan förbereda hur många objekt man vill innan man startar det automatiska flödet. Den automatiska processen kan ske helt obevakad (under förutsättning att nätverket fungerar som det ska, annars kommer flödet stanna vid ocr-hanteringen).

  1. Byt till Work-vy (display work). Denna uppgift är en säkerhetsåtgärd som garanterar att programmet inte genomför några förändringar på masterfilen.
  2. Beskärning (cropping). Sidorna beskärs efter de värden vi gett beskärningsramen under punkt 5 ovan.
  3. Räta upp (deskew). Eftersom vi tidigare räknat ut ramvärdena vet programmet nu hur skev varje sida är och kan utifrån denna data räta upp dem som behövs. Är inte ramvärdena uträknade justerar programmet ingenting, utan går vidare till nästa uppgift i flödet.
  4. Kontrastjustering. För att öka kontrasten mellan text och bakgrund och därigenom öka läsbarheten, sänks programmets standardvärden för brightness till -35.
  5. Bilderna görs bitonala (binarize).
  6. Texten görs sökbar. Bilderna skickas till OCR-servern som gör texten sökbar och därefter slår ihop alla sidor till en PDF-fil. Därefter skickas filen tillbaks till treventusdatorn.
  7. Kopiera till ”Klara”. Masterfilerna kopieras från treventusdatorn till en lagringsserver, därefter kopieras PDF-filen = visningsfilen till samma ställe.

Som en sista uppgift skulle man kunna låta programmet radera treventusdatorns master-, work- och bitonala bilder, eftersom både mastern och visningsfilen nu finns lagrad på annan plats. Denna uppgift kommer vi lägga till när vi är säkra på att flödet alltid sker med en hundraprocentig tillförlitlighet.


Komplettering och kontroll (manuell)

Skanningsarbetet avlutas med ett sista manuellt flöde.

  1. Omslag, lösa ark och ev de sidor som ej tidigare kunnat skannas, skannas i en flatbäddsskanner.
  2. Omslag och sidor läggs i den masterfilkatalog de tillhör.
  3. De lösa arken och andra tillkomna sidor görs bitonala. Omslagen lämnas orörda.
  4. Omslag och bitonala sidor integreras i aktuell visningsfil. (Adobe Acrobat)
  5. Tomma sidor som inte har en inverkan på visningsfilens paginering tas bort. (Adobe Acrobat)
  6. Ev skuggor tas bort genom manuell beskärning. (Adobe Acrobat)
  7. Anti-aliasing appliceras på texten för ökad läskomfort. (Adobe Acrobat)
  8. I databasen noteras att verket är färdigskannat.

Slutresultatet är bra med en god läsbarhet. Vi har dock vissa problem med objekt där innehållet går ända ut i marginalerna. I somliga fall är det svårt och ibland rent av helt omöjligt att komma åt all information på sidan, eftersom skannerhuvudet inte kan gå tillräckligt djupt ner. Vi har också en del problem med skuggade sidor. Skuggorna kan vara knappt märkbara på masterbilderna, men när de binäriseras, förvandlas skuggpartierna till kompakta helsvarta områden, vilket påtagligt stör när man läser. Eftersom skuggorna kan vandra ganska långt in på sidorna, går det heller inte att lösa problemet genom att skära bort dessa områden i scanflow (vi använder samma, statiska beskärningsram för samtliga sidor), då detta skulle innebära att vi också skar bort delar av informationen på sidan. Tills vidare löser vi problemet med en manuell hantering i Adobe Acrobat.

Nu går vi in i nästa fas i arbetsflödet, fasen som innefattar metadataberikningen och tillgängliggörandet av materialet i GUPEA och LIBRIS. Mer om detta arbete i vår nästa bloggpost som vi hoppas kunna lägga upp i början av oktober.

onsdag 25 maj 2011

GUB: Bildfångst påbörjad

Göteborgs universitetsbibliotek har nu påbörjat det praktiska skanningsarbetet. Där vi först planerade att rikta in oss på avhandlingar utgivna av Göteborgs universitet, har vi nu efter en beställning från pedagogiska institutionen istället beslutat att digitalisera ungefärligen 120 st av deras rapporter, skrivna mellan 1960-2000. Innehållsmässigt behandlar rapporterna hur en rad olika faktorer påverkar både ungdomars och vuxnas vilja och möjlighet till utbildning. Till formen/dimensionerna är materialet av väldigt olika karaktär och innefattar tunna A5-häften på några få sidor såväl som tjockare A4-sammansättningar på uppemot 200 s. Gemensamt för många av objekten är dock att de har limmade ryggar, de har lätt-OCR:ade typsnitt och att de inte är skrivna på mer än fem olika västeuropeiska språk, vilket också underlättar vid OCR-processen. Vi kommer köra flertalet av rapporterna i treventusroboten. Får vi tillstånd av institutionen kan vi också komma att skära vissa av objekten och låta hantera dem i en arkskanner för att kunna jämföra de olika skanningsmetoderna med varandra.

Under arbetets gång försöker vi gå systematiskt tillväga och dokumentera vårt förfarande så att vi i ett senare läge lättare kan felsöka och rätta till de märkliga fel och beteenden som uppstår med jämna mellanrum. I nuläget verkar vi dock ha fått in ett ganska bra flöde på själva bildfångsten, vi tycks ha kommit till bukt med de tidigare problem vi hade med limmade ryggar där arken satt tätt ihop vilket gjorde att bladvändning inte fungerade som den skulle. Men så inte längre. Vi har också blivit bättre på att orientera oss i Scangates kryptiska gränssnitt och har lyckats få till en grundinställning som gör att både masterfiler och presentationsfiler (de som syns under ”work”- resp ”bitonal”-vyn) genereras vid ursprungsskanningen, istället för att man ska behöva ägna vad det känns som mycket längre tid åt att skapa presentationsfilerna vid ett senare tillfälle. En inställning som gör att endast högra sidor skannas (varannan sida i flera rapporter är en sida utan innehåll) gör att vi redan från början filtrerar bort onödig data som tynger ned efterbehandlingen. Vad som återstår att komma fram till vilka gammavärden vi skall lägga oss på, vissa sidor tenderar att bli lite väl bleka.

Det vi alltså hittills fokuserat på är själva bildfångsten. Tanken är att vi först när alla rapporter är inskannade och vi har säkerställt att kvaliteten är tillräckligt bra, påbörjar efterbehandlingen. I samband med efterbehandlingen börjar vi använda Scanflow som vi hittills experimenterat med men som vi måste bli bättre på om processen skall kunna flyta helt automatiskt. Och apropå flödesprogram kan vi också nämna att vi var på Comprimas presentation härom veckan där vi bl a fick en genomgång av DocWorks-e som åtminstone på pappret ser ut som en väldigt lovande programvara, inte minst för att den innehåller en komponent vilken (via z39.50) automatiskt kan hämta metadata från LIBRIS – vilket i nuläget är lite av en flaskhals i vår process. DocWorks-e bygger också på ett betydligt mer grafiskt gränssnitt som vid en första anblick verkar vara mycket lättare att förstå sig på än det vi är tvungna att arbeta med idag. Just gränssnittsfrågan är ju viktig om man tänker sig att man framöver vill låta studenter eller ny, ambulerande personal sköta skanningen men samtidigt har begränsat med tid att utbilda dem. Enklare gränssnitt = förkortad inlärningskurva.