From 6b19daf1d28a8f4848bfb537b2cb45bb36dc7ea7 Mon Sep 17 00:00:00 2001 From: Alex Osborne Date: Tue, 17 Aug 2021 09:07:04 +0900 Subject: [PATCH] ExtractorChrome: Don't capture data: URIs They are already captured as part of their containing document. There's no need to record them separately. #430 --- .../java/org/archive/modules/extractor/ExtractorChrome.java | 3 ++- .../org/archive/modules/extractor/ExtractorChromeTest.java | 1 + 2 files changed, 3 insertions(+), 1 deletion(-) diff --git a/contrib/src/main/java/org/archive/modules/extractor/ExtractorChrome.java b/contrib/src/main/java/org/archive/modules/extractor/ExtractorChrome.java index 4d7c3a54..c1b38398 100644 --- a/contrib/src/main/java/org/archive/modules/extractor/ExtractorChrome.java +++ b/contrib/src/main/java/org/archive/modules/extractor/ExtractorChrome.java @@ -29,6 +29,7 @@ import org.archive.modules.ProcessorChain; import org.archive.net.chrome.*; import org.archive.spring.KeyedProperties; import org.archive.util.Recorder; +import org.archive.util.UriUtils; import org.json.JSONArray; import org.springframework.context.ApplicationEventPublisher; @@ -220,7 +221,7 @@ public class ExtractorChrome extends ContentExtractor { } private void handleCapturedRequest(CrawlURI via, ChromeRequest request) { - if (request.isResponseFulfilledByInterception()) { + if (request.isResponseFulfilledByInterception() || UriUtils.isDataUri(request.getUrl())) { return; } diff --git a/contrib/src/test/java/org/archive/modules/extractor/ExtractorChromeTest.java b/contrib/src/test/java/org/archive/modules/extractor/ExtractorChromeTest.java index 78c8e157..f3a39166 100644 --- a/contrib/src/test/java/org/archive/modules/extractor/ExtractorChromeTest.java +++ b/contrib/src/test/java/org/archive/modules/extractor/ExtractorChromeTest.java @@ -67,6 +67,7 @@ public class ExtractorChromeTest { response.setContentType("text/html"); response.getWriter().write("link" + "" + + "" + "" + ""); baseRequest.setHandled(true);