Hoppa till innehållet

Praktisk PDF-guide

Skannad PDF och PDF med text kan se likadana ut

Det som ser ut som en mening kan vara riktiga tecken i PDF:en eller bildpunkter i ett fotografi. Skillnaden avgör om texten går att redigera.

Innehållet reviderat .

Tre typer du kan stöta på

  • PDF med text: dokumentet innehåller tecken som en PDF-läsare kan markera, söka och kopiera.
  • Bild utan textlager: en skannad eller fotograferad sida ser läsbar ut, men orden består av bildpunkter.
  • Bild med OCR-textlager: sidan visas som en bild medan igenkänd text ligger ovanpå eller bakom den. Den igenkända texten kan innehålla fel.

En PDF kan innehålla olika typer på olika sidor. Det räcker därför inte att testa bara första sidan.

Prova att markera, kopiera och söka

  1. Öppna PDF:en i en läsare som har textmarkering.
  2. Markera en mening och kopiera den till ett tomt textdokument.
  3. Kontrollera att bokstäver, ordning och svenska tecken blir rätt.
  4. Sök efter ett synligt ord på flera olika sidor.

Om meningen inte går att markera kan sidan vara en bild. Det kan också handla om begränsningar i läsaren, dokumentets skydd eller dess teckenkodning. Att kopierad text blir fel betyder att det finns något att granska, inte att originalet är säkert att konvertera utan kontroll.

Jämför två syntetiska exempel

Textintyget innehåller riktiga PDF-tecken, bland annat å, ä, ö, Å, Ä, Ö. Bildintyget innehåller synlig text inuti en JPEG-bild utan PDF-textlager. Det andra är en skapad bildsida, inte en skanning av ett riktigt intyg.

Den automatiska kontrollen läste text från textfilerna och bekräftade att bildintyget saknade textlager. PDF till Word avvisade bildintyget i stället för att skapa en tom DOCX. Den kontrollen utlovar inte att alla skannade eller blandade dokument upptäcks.

Välj verktyg efter det resultat du behöver

Jag behöver redigerbar text

PDF till Word kan läsa befintlig PDF-text och bygga en DOCX-fil. Den här implementationen har ingen OCR och kan inte tolka orden i en ren sidbild. En bildbaserad sida utan läsbar text stoppar även ett blandat dokument. Bilder följer inte med och tabeller eller spalter kan behöva göras om. Kontrollera att texten från varje önskad sida finns i ett konverterat resultat.

OCR betyder textigenkänning från bilder. Det finns lösningar som kan göra det i webbläsare eller andra program, men det ingår inte i den här tjänsten. Om du använder ett annat verktyg, kontrollera hur det hanterar dina filer och granska särskilt namn, datum och siffror i den igenkända texten.

Jag behöver en bild av sidan

PDF till JPG avbildar hela sidan. Det fungerar som ett annat slags resultat: text och länkar blir bildpunkter, även när originalet hade ett textlager. För att samla egna JPG- och PNG-filer finns Bilder till PDF, som inte lägger till sökbar text.

Jag behöver bara vissa PDF-sidor

Dela PDF kopierar valda sidor till nya PDF-filer. Du behöver inte konvertera till JPG för att ta ut en sida. Text och bilddata kan då behållas, men formulär, bokmärken, interna länkar och digitala signaturer behöver kontrolleras i det nya dokumentet.

Tänk på textlagret före komprimering

Stark PDF-komprimering bygger om sidorna till bilder. Ett befintligt textlager försvinner då, oavsett om det skapats från ett ordbehandlingsprogram eller genom OCR. Börja med strukturellt läge om du behöver behålla sökbar text och läs guiden om filstorlek och kvalitet.

Behåll alltid originalet. Att en ny fil går att öppna betyder inte att den har kvar det innehåll och de funktioner du behöver.

Välj rätt verktyg