From 2e10d07da2728909d0ebb332e376494bf333209b Mon Sep 17 00:00:00 2001 From: gojomo Date: Thu, 14 Jul 2011 06:53:56 +0000 Subject: [PATCH] [HER-741] Make extractors interrogate for charset * ExtractorHTML fix reflexive probe to look as many characters in (1000) as initially --- .../main/java/org/archive/modules/extractor/ExtractorHTML.java | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java index 351ad90e..9122cf18 100644 --- a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java +++ b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java @@ -672,7 +672,7 @@ public class ExtractorHTML extends ContentExtractor implements InitializingBean String contentPrefix = curi.getRecorder().getContentReplayPrefixString(1000); Charset contentDeclaredEncoding = getContentDeclaredCharset(curi,contentPrefix); if(!curi.getRecorder().getCharset().equals(contentDeclaredEncoding) && contentDeclaredEncoding!=null) { - String newContentPrefix = curi.getRecorder().getContentReplayPrefixString(50,contentDeclaredEncoding); + String newContentPrefix = curi.getRecorder().getContentReplayPrefixString(1000,contentDeclaredEncoding); Charset reflexiveCharset = getContentDeclaredCharset(curi, newContentPrefix); if(contentDeclaredEncoding.equals(reflexiveCharset)) { // content-declared charset is self-consistent; use