diff --git a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java index c5f710c8..f97e6d86 100644 --- a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java +++ b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java @@ -694,16 +694,24 @@ public class ExtractorHTML extends ContentExtractor implements InitializingBean // assume it's okay to extract } } - + String mime = uri.getContentType().toLowerCase(); - return mime.startsWith("text/html") + if (mime.startsWith("text/html") || mime.startsWith("application/xhtml") || mime.startsWith("text/vnd.wap.wml") || mime.startsWith("application/vnd.wap.wml") - || mime.startsWith("application/vnd.wap.xhtml"); + || mime.startsWith("application/vnd.wap.xhtml")) { + return true; + } + + String contentPrefixLC = uri.getRecorder().getContentReplayPrefixString(1000).toLowerCase(); + if (contentPrefixLC.contains("