From afc2a55e495c2ce184d57266b53f1d56dbd86ed2 Mon Sep 17 00:00:00 2001 From: szznax Date: Fri, 13 Aug 2010 00:37:55 +0000 Subject: [PATCH] fix for [HER-1808] uncaught URLDecoder IllegalArgumentException in ExtractorHTML * ExtractorHTML.java still consider values rejected by URLDecoder --- .../main/java/org/archive/modules/extractor/ExtractorHTML.java | 3 +++ 1 file changed, 3 insertions(+) diff --git a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java index 0584aa36..94945a0c 100644 --- a/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java +++ b/modules/src/main/java/org/archive/modules/extractor/ExtractorHTML.java @@ -538,6 +538,9 @@ public class ExtractorHTML extends ContentExtractor implements InitializingBean if (encodedKeyVal.length == 2) try { String value = URLDecoder.decode(encodedKeyVal[1], "UTF-8"); considerIfLikelyUri(curi, value, valueContext, hop); + } catch (IllegalArgumentException e) { + // still consider values rejected by URLDecoder + considerIfLikelyUri(curi, encodedKeyVal[1], valueContext, hop); } catch (UnsupportedEncodingException e) { throw new AssertionError("all jvms must support UTF-8, and yet somehow this happened: " + e); }